{"as_of":"2026-08-10T14:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9296c085dbf3f3298dc0af5994514c806a5dc495b0380af4b20dba0c687d6b94","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":31,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T17:01:36.169940Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":18,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-12T16:22:08.801066Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2205.14135"},"observation_digest":"sha256:64b47ff7d5fd69f70a268625eae6405b461c0e19e5528dac9b02f2b48cfc5b81","observation_id":"b6a711ae-3328-4a71-93e3-8b9e79ecf0ac","resolution":{"observed_at":"2026-05-12T16:22:08.919757Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":128,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:1a2ac5e55bd119184992bac13b018a9b42ad6a02fabacc59af71eded2102e9f0","observation_id":"972429b4-e267-4ac3-9c40-c444ea8b69f1","resolution":{"observed_at":"2026-05-19T20:28:39.429937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-11T02:39:44.770344Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2307.08691"},"observation_digest":"sha256:15df956d140fd2819eff6649d70366c458c832265b1795bd535356d29cdc1fdf","observation_id":"d752eee2-551f-47db-94aa-fcf3b9ece64c","resolution":{"observed_at":"2026-05-11T02:39:44.880343Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-08-06T06:52:14.558389Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-24T06:51:02.531751Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2309.10305"},"observation_digest":"sha256:87f7ddbd1f1077c9afd16e5e8ece98245f797533d18b2e3d3e99ef53e76bb018","observation_id":"10b33196-1bd4-498c-be96-9d339123afc1","resolution":{"observed_at":"2026-05-24T06:54:03.598810Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-12T19:28:28.201789Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2310.01889"},"observation_digest":"sha256:02932d3d0916f8cc9d41e6fbabfb058c1860ac55c7d0de82a28d148ef6dfed4e","observation_id":"2e9a9a31-4350-484f-8963-3297da5c085e","resolution":{"observed_at":"2026-05-12T19:28:28.282101Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:44f78107d867e8ecc1b191798079e0b192b596de24a1fe0fbac9a5dd248ac02b","observation_id":"d4475732-bcaf-4502-a2e0-0e72730aac4d","resolution":{"observed_at":"2026-05-16T09:46:10.152199Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-07-06T18:44:53.587276Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-20T19:45:36.337956Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2407.08608"},"observation_digest":"sha256:ccaf897198f762f37ebc6029a34c0f956aa027341c90191ef40b381edfc542c6","observation_id":"04abeaa0-441c-474a-a619-144c1b0a10b8","resolution":{"observed_at":"2026-05-20T19:45:36.409336Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-08-09T23:53:42.648697Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"reference_index":230,"source":"arxiv_source","source_observed_at":"2026-05-18T06:38:36.517935Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2408.00724"},"observation_digest":"sha256:c8e4c79d42049374992226468b96a4454328804eb4e48a5114c8de90c37e7a3d","observation_id":"81b46da2-31a4-4759-8c9c-ba8f692f9a17","resolution":{"observed_at":"2026-05-18T06:38:37.006933Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2411.12502","last_updated":"2026-04-17T12:18:58Z","snapshot_observed_at":"2026-07-06T19:52:33.374340Z","submitted_at":"2024-11-19T13:40:49Z","title":"Transformer Neural Processes - Kernel Regression","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-23T08:36:55.970834Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2411.12502"},"observation_digest":"sha256:7d34147a53228eb00335785fe5e44326e96c87d930a9324fc9e5918181fd1406","observation_id":"ea0f0ed2-e6b4-43a2-9b2e-39585cda9e9d","resolution":{"observed_at":"2026-05-23T08:37:44.960168Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2412.03594","last_updated":"2026-04-22T15:33:51Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-11-29T05:57:37Z","title":"BatchLLM: Optimizing Large Batched LLM Inference with Global Prefix Sharing and Throughput-oriented Token Batching","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T16:57:46.645061Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2412.03594"},"observation_digest":"sha256:d8f881d3101dbce34302470d8147cb589720b8a199cb9d96ed65e9ea0045f4c3","observation_id":"b8637c49-e944-40d8-90df-d2cfae424361","resolution":{"observed_at":"2026-05-23T16:58:11.950592Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2412.05496","last_updated":"2024-12-07T01:46:38Z","snapshot_observed_at":"2026-08-07T15:28:16.662668Z","submitted_at":"2024-12-07T01:46:38Z","title":"Flex Attention: A Programming Model for Generating Optimized Attention Kernels","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T21:27:16.615071Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2412.05496"},"observation_digest":"sha256:6871d77be1b2aabc161831013ed862bb5cdd77f347577e7ed6ddb4258b6dffbe","observation_id":"cc33bdb7-acf2-469e-94b6-81f3970129cd","resolution":{"observed_at":"2026-05-17T21:27:16.668684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-08T17:01:36.169940Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06042","last_updated":"2025-05-26T18:48:37Z","snapshot_observed_at":"2026-08-09T10:18:57.511599Z","submitted_at":"2025-02-09T21:44:27Z","title":"Scaling Laws for Forgetting during Finetuning with Pretraining Data Injection","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-08T17:01:36.169940Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2502.06042"},"observation_digest":"sha256:47c00ceca19f71890a6a466c9e799b6152a117e598ab617aa90be592e2b953dd","observation_id":"d1acaf38-48d1-4533-b92d-d1ccf2ea4737","resolution":{"observed_at":"2026-08-08T17:01:36.169940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T15:42:43.089177Z","title":"Self-attention does not need O(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14201","last_updated":"2025-05-20T11:01:33Z","snapshot_observed_at":"2026-08-07T15:36:15.927880Z","submitted_at":"2025-05-20T11:01:33Z","title":"FLASH-D: FlashAttention with Hidden Softmax Division","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:43.089177Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2505.14201"},"observation_digest":"sha256:2491f603f4a096d5205b57717666ea88a5c2580edd94bf7729b492023e0f5294","observation_id":"d1bdae36-d87c-4e8e-bc7c-ff74eab4a9a4","resolution":{"observed_at":"2026-08-07T15:42:43.089177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T15:42:46.917536Z","title":"Self-attention does not needO(n 2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14314","last_updated":"2025-05-30T10:32:39Z","snapshot_observed_at":"2026-08-10T06:42:45.163460Z","submitted_at":"2025-05-20T13:00:59Z","title":"Low-Cost FlashAttention with Fused Exponential and Multiplication Hardware Operators","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:42:46.917536Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2505.14314"},"observation_digest":"sha256:232edd09028083fdb65da9388e8794beacf9487c345a445df3f4cf9610783a45","observation_id":"9f593de3-9fa0-436f-8301-0952ca9795bd","resolution":{"observed_at":"2026-08-07T15:42:46.917536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T11:32:21.904574Z","title":"Rabe and Charles Staats","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.02267","last_updated":"2025-06-02T21:15:20Z","snapshot_observed_at":"2026-08-09T00:08:36.329787Z","submitted_at":"2025-06-02T21:15:20Z","title":"TransAct V2: Lifelong User Action Sequence Modeling on Pinterest Recommendation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:32:21.904574Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2506.02267"},"observation_digest":"sha256:18bce3492747412548649a55d1155d9b18330ee4ffbe4efc116dc2fb120e790a","observation_id":"643622ba-c6d2-42da-98a4-a59551229b5a","resolution":{"observed_at":"2026-08-07T11:32:21.904574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-07T10:47:52.364862Z","title":"Self-attention does not need O(n2)memory.arXiv preprint arXiv:2112.05682, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04421","last_updated":"2025-06-04T20:08:07Z","snapshot_observed_at":"2026-08-10T04:27:59.621432Z","submitted_at":"2025-06-04T20:08:07Z","title":"HMAR: Efficient Hierarchical Masked Auto-Regressive Image Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T10:47:52.364862Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2506.04421"},"observation_digest":"sha256:2ad528d1f8da1fc9766b625b5ad336a59333d681e21defb5c22120770b0f5ffd","observation_id":"89ad099d-36a3-4b2d-bd40-0f1fcc7e8357","resolution":{"observed_at":"2026-08-07T10:47:52.364862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-06T17:59:43.755282Z","title":"Rabe and Charles Staats","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.09612","last_updated":"2025-07-13T12:33:37Z","snapshot_observed_at":"2026-08-08T05:37:36.169460Z","submitted_at":"2025-07-13T12:33:37Z","title":"Inter2Former: Dynamic Hybrid Attention for Efficient High-Precision Interactive","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T17:59:43.755282Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2507.09612"},"observation_digest":"sha256:037c0d5127b965aa448dd9962286ff257b832090c0c11d6b11d9cf53733d01b6","observation_id":"38941a85-0e27-44a0-bfcd-2a070ef9bc96","resolution":{"observed_at":"2026-08-06T17:59:43.755282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-06T16:41:46.317905Z","title":"Self-attention does not need o(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.12771","last_updated":"2025-07-17T04:16:24Z","snapshot_observed_at":"2026-08-08T20:58:54.437650Z","submitted_at":"2025-07-17T04:16:24Z","title":"Local Representative Token Guided Merging for Text-to-Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T16:41:46.317905Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2507.12771"},"observation_digest":"sha256:700f98bc17be4d164391310385ab08c145c69fbc8ceb5b7358499fdac439046c","observation_id":"7216fa82-e54e-4411-b98e-efde2995ecbb","resolution":{"observed_at":"2026-08-06T16:41:46.317905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-06T15:11:14.081783Z","title":"Self-attention does not need O(n2) memory,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16676","last_updated":"2025-07-22T15:11:13Z","snapshot_observed_at":"2026-08-06T15:02:10.237281Z","submitted_at":"2025-07-22T15:11:13Z","title":"Custom Algorithm-based Fault Tolerance for Attention Layers in Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:11:14.081783Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2507.16676"},"observation_digest":"sha256:2ce4b51c0a83d714db3b106a1182a2e42270c81e4d93824b3064c0259a370db0","observation_id":"638ae11d-b20d-40e9-b01c-805952011d9b","resolution":{"observed_at":"2026-08-06T15:11:14.081783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T21:38:54.293572Z","title":"Self-attention does not needo(n2)memory.arXiv preprint arXiv:2112.05682,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.08192","last_updated":"2025-08-11T17:11:26Z","snapshot_observed_at":"2026-08-10T11:25:18.567424Z","submitted_at":"2025-08-11T17:11:26Z","title":"Efficient Speculative Decoding for Llama at Scale: Challenges and Solutions","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T21:38:54.293572Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2508.08192"},"observation_digest":"sha256:779429b3880590210e0b12b943d14e5b8884cd02a6289e536ef0ae8861fc1356","observation_id":"99e518d1-e991-443a-a8e0-5e07929bd86f","resolution":{"observed_at":"2026-08-05T21:38:54.293572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2602.00520","last_updated":"2026-05-14T03:32:56Z","snapshot_observed_at":"2026-08-02T03:39:39.274251Z","submitted_at":"2026-01-31T05:21:27Z","title":"NEST: Nested Event Stream Transformer for Sequences of Multisets","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T09:20:04.153122Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2602.00520"},"observation_digest":"sha256:2f621efc1ef952d85a3f7cb2b83271cbd7fb6eeea2e1e1a2fd02ca69e81b7f64","observation_id":"0b3b49d8-a9f9-41e2-bda2-7a53544e8126","resolution":{"observed_at":"2026-05-16T09:20:47.663417Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2604.02654","last_updated":"2026-04-03T02:35:32Z","snapshot_observed_at":"2026-07-06T22:51:57.889822Z","submitted_at":"2026-04-03T02:35:32Z","title":"Drift-Resilient Temporal Priors for Visual Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T19:50:03.094100Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2604.02654"},"observation_digest":"sha256:4eea7162d784c6f39dca1cae1d0c4ead3067f3da654621fa9e3593d8df576a08","observation_id":"ee937aa5-6b7e-42bf-9640-f141a66bb86c","resolution":{"observed_at":"2026-05-13T19:53:11.800078Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2604.15408","last_updated":"2026-05-12T17:43:19Z","snapshot_observed_at":"2026-08-02T22:57:05.591619Z","submitted_at":"2026-04-16T15:48:44Z","title":"Dispatch-Aware Ragged Attention for Pruned Vision Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-10T11:34:19.658008Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2604.15408"},"observation_digest":"sha256:e0eefc9baad0ed18c59a12e9fa63877af5325a826c83453e36229ce6e03fb98d","observation_id":"d4707d6d-ce4b-4c31-b737-880614fbfba8","resolution":{"observed_at":"2026-05-10T11:35:18.742860Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2604.15408","last_updated":"2026-05-12T17:43:19Z","snapshot_observed_at":"2026-08-02T22:57:05.591619Z","submitted_at":"2026-04-16T15:48:44Z","title":"Dispatch-Aware Ragged Attention for Pruned Vision Transformers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T07:48:16.052462Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2604.15408"},"observation_digest":"sha256:3eab2e3f60c3b8051bc25e75c96858699cce0fa4b41c53176a5c7310fefbeefb","observation_id":"205bb844-086f-434c-8e74-121fbf1e6989","resolution":{"observed_at":"2026-05-13T07:52:32.334786Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2604.16864","last_updated":"2026-04-18T06:28:21Z","snapshot_observed_at":"2026-08-02T05:52:50.560554Z","submitted_at":"2026-04-18T06:28:21Z","title":"HieraSparse: Hierarchical Semi-Structured Sparse KV Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T07:15:19.184970Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2604.16864"},"observation_digest":"sha256:a7a6205576c745fb1851314a56b0c57220d3ea71659b94664fdb9e543d86ef04","observation_id":"923a333d-45d7-41d8-b935-f4c342be3ec1","resolution":{"observed_at":"2026-05-10T07:16:54.124178Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2604.21215","last_updated":"2026-04-23T02:12:58Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T02:12:58Z","title":"The Recurrent Transformer: Greater Effective Depth and Efficient Decoding","version":1},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-09T22:03:35.260373Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2604.21215"},"observation_digest":"sha256:5bfca4e0a50580c5a6e45208fd6574c1acc63951bf3d3ad5bb0ac0db27dd31a9","observation_id":"65597e69-dfee-4232-8119-d19a8694aae1","resolution":{"observed_at":"2026-05-11T14:21:04.643546Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2604.23798","last_updated":"2026-04-26T16:41:30Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T16:41:30Z","title":"ELSA: Exact Linear-Scan Attention for Fast and Memory-Light Vision Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T06:33:10.730973Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2604.23798"},"observation_digest":"sha256:6ff602dc1c3611125b14a07f01481fed4ba95dba45e08e8a60194ed7ccaa2483","observation_id":"9c77f844-1a35-43dd-864d-5f32381df7d2","resolution":{"observed_at":"2026-05-11T21:11:17.606339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2605.18226","last_updated":"2026-05-18T11:12:45Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T11:12:45Z","title":"Context Memorization for Efficient Long Context Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-20T10:39:09.720412Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2605.18226"},"observation_digest":"sha256:9d48eafd2434964c6bff218fae46ca43cb9d55921d84167739be67359fe301f0","observation_id":"9d47a2eb-ad46-43c1-a937-23bf0f14a43b","resolution":{"observed_at":"2026-05-20T10:43:12.653023Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":"2112.05682","doi":"10.48550/arxiv.2112.05682","metadata_source":"arxiv_reference","pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rabe and Charles Staats","venue":"arXiv (Cornell University)","work_id":"70a54759-fbc9-4b65-a3c6-d4ed45ca0cae","year":2021},"citing_paper":{"arxiv_id":"2606.10537","last_updated":"2026-06-09T08:06:22Z","snapshot_observed_at":"2026-08-06T08:45:04.024766Z","submitted_at":"2026-06-09T08:06:22Z","title":"Prefilling-dLLM: Predictive Prefilling for Long-Context Inference in Diffusion Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-27T13:30:19.620692Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2606.10537"},"observation_digest":"sha256:e00ddafa1e51b06fd10e09597cfd1a2947b46e9590547b7c2cabc3369be46a1b","observation_id":"a1e99ec1-568c-452f-ac75-a04e0eb6ee8b","resolution":{"observed_at":"2026-07-03T04:57:38.691461Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T15:50:14.997252+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-07-12T02:29:52.764344Z","title":"and Staats, Charles , month = oct, year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05439","last_updated":"2026-07-03T15:50:24Z","snapshot_observed_at":"2026-07-12T02:29:47.974846Z","submitted_at":"2026-07-03T15:50:24Z","title":"Design-CP: Context Parallelism for Design of Protein Nanoparticles","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-07-12T02:29:52.764344Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2607.05439"},"observation_digest":"sha256:5df4bd1da386df10edee80748eb66679ca28e651385e7d3f1caa3a057485bdbc","observation_id":"100734a7-637b-4833-800d-0d27d27b588a","resolution":{"observed_at":"2026-07-12T02:29:52.764344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-07-31T05:06:55.085464Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.24954","last_updated":"2026-07-27T18:04:26Z","snapshot_observed_at":"2026-08-10T09:10:10.339810Z","submitted_at":"2026-07-27T18:04:26Z","title":"Intrinsic and Triangulation-Agnostic Attention: A Simple and Powerful Approach for Learning on Meshes","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-31T05:06:55.085464Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2607.24954"},"observation_digest":"sha256:c3b6b9dfcdccd1450f8d37440bed68bc0cdc42e87b64444ae8208266523e368e","observation_id":"868777fa-406b-4c51-8148-393509166bad","resolution":{"observed_at":"2026-07-31T05:06:55.085464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.05682/citation-record","integrity":"/paper/2112.05682/integrity","json":"/paper/2112.05682/citation-record.json","paper":"/paper/2112.05682"},"outbound":[],"paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T17:49:01.053607Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 31 inbound Pith citation observations for arXiv:2112.05682."}