{"as_of":"2026-08-20T11:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bcf66729e606bb72a412705dc2ba53b4cc849c052a98269155edc8431e5f6906","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:37:04.085148Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12526/citation-record","integrity":"/paper/2504.12526/integrity","json":"/paper/2504.12526/citation-record.json","paper":"/paper/2504.12526"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-08-15T06:28:09.529747Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-16T12:37:03.988247Z","title":"Accessed: 2025-03-25","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:03.988247Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:b902ec3a993fbc4b5807f828537619a981438ab5c9c8166fb5fdba28fe65be98","observation_id":"b70a65be-caa0-4bb3-b59c-291bb1c85459","resolution":{"observed_at":"2026-08-16T12:37:03.988247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-16T12:37:03.992561Z","title":"Accessed: 2025-03-25","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:03.992561Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:8a07c619d4406549f4299d52a7d52699ec4bb4b918c1b20727890e82c14a3888","observation_id":"fa6949e7-5842-4636-ac8f-41535f3bb3de","resolution":{"observed_at":"2026-08-16T12:37:03.992561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T12:37:03.996360Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:03.996360Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:ab088a9370731a4c5fc740fb992d4494a87d14aabeb6aa6e787a30ed6d2efedc","observation_id":"31f4d700-c7d4-4df3-ad0c-bec071bdc39a","resolution":{"observed_at":"2026-08-16T12:37:03.996360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:04.003900Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.003900Z"},"links":{"citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:85282d3edd4286611f6c731c28b740bc5b00785479b69f30f96a79ef194870dd","observation_id":"8681f33d-23d5-41f8-bbef-d8f61945dffc","resolution":{"observed_at":"2026-08-16T12:37:04.003900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T14:33:36.303679Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-16T12:37:04.007481Z","title":"Training deep nets with sublinear memory cost","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.007481Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:1958260923d8d997c10a2d3fb1f2715852587d9d861acf449b27a20cd39216ff","observation_id":"d79c5867-c0c3-46bd-a45f-303d2b5cc021","resolution":{"observed_at":"2026-08-16T12:37:04.007481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.08415","last_updated":"2023-06-06T01:53:32Z","snapshot_observed_at":"2026-08-13T19:48:28.322536Z","submitted_at":"2016-06-27T19:20:40Z","title":"Gaussian Error Linear Units (GELUs)","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.08415","snapshot_observed_at":"2026-08-16T12:37:04.018509Z","title":"Gaussian error linear units (gelus)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.018509Z"},"links":{"cited_paper":"/paper/1606.08415","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:853d3fe77add7142d8d9295a94bd37046363652c601a88674a654d3ce8fc9add","observation_id":"30c09d60-b4cd-4590-b376-b88b837cebdf","resolution":{"observed_at":"2026-08-16T12:37:04.018509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T12:37:04.025925Z","title":"11 Preprint","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.025925Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:901d5e7e86c5b83a023177c22aa567434b0f628f88cd9ef0182042d1c30fe9d4","observation_id":"937d8f17-05b4-4a40-bb8b-89c176168bc0","resolution":{"observed_at":"2026-08-16T12:37:04.025925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-16T12:37:04.029176Z","title":"Nikita Kitaev, Łukasz Kaiser, and Anselm Levskaya","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.029176Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:afeb7392362a73bcbd8fea564766d981afbfcf631690fdbe6cc2ca989a6adb61","observation_id":"1f4ddbd4-941d-45d2-9e05-cdd1e23d34f1","resolution":{"observed_at":"2026-08-16T12:37:04.029176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-16T12:37:04.033106Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.033106Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:4b6b0b86c766cae6d97e707ba25d4dbc3c6a0c359555c4373401c0e14d0b8619","observation_id":"5edd78aa-6606-4dbe-b703-8c4264f82efe","resolution":{"observed_at":"2026-08-16T12:37:04.033106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:04.403992Z","title":null,"venue":null,"work_id":"eb529944-3ad5-4fe9-a3ec-98c178775d85","year":2024},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.040394Z"},"links":{"citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:ad5ca6e31d15f344cc9d9fa433f909bcb0b9d773686d04c7540c263a0ac7e9e5","observation_id":"791d11af-e209-41c9-ab6f-5e3dd20a6002","resolution":{"observed_at":"2026-08-16T12:37:04.407195Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.05941","last_updated":"2017-10-27T17:45:21Z","snapshot_observed_at":"2026-08-08T18:23:31.977872Z","submitted_at":"2017-10-16T18:05:45Z","title":"Searching for Activation Functions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.05941","snapshot_observed_at":"2026-08-16T12:37:04.050659Z","title":"Searching for activation functions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.050659Z"},"links":{"cited_paper":"/paper/1710.05941","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:9e3fa6b4389cc221efb1b229dcf54ab4dd7a8576cbbbedb3e8cae9ccbb3e6166","observation_id":"cc669be0-b05f-4031-9f2a-697391eca331","resolution":{"observed_at":"2026-08-16T12:37:04.050659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:04.054919Z","title":"Morgane Riviere, Shreya Pathak, Pier Giuseppe Sessa, Cassidy Hardin, Surya Bhupatiraju, L´eonard Hussenot, Thomas Mesnard, Bobak Shahriari, Alexandre Ram´e, Johan Ferret, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.054919Z"},"links":{"citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:1d1f28efbce3498a78bf76781dfabfe2a28742990f3cfa2df91991846084ab73","observation_id":"ef5976cd-401f-429c-bfe3-41c2a001659b","resolution":{"observed_at":"2026-08-16T12:37:04.054919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-16T12:37:04.058048Z","title":"Accessed: 2025-03-23","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.058048Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:e1a61cbb47e3c0fc32052e354855806b431af1f2b0e18f2ed736001435973be0","observation_id":"506542d0-83bf-4bd0-ade7-dd566ec2f791","resolution":{"observed_at":"2026-08-16T12:37:04.058048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T12:37:04.064915Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.064915Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:6ce20191323159c0411a214c3fa2cbc72ff7e192b573a09b6318ee17d7863214","observation_id":"b44b3e81-c2b0-4f14-92fc-06759c5f9257","resolution":{"observed_at":"2026-08-16T12:37:04.064915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-16T12:37:04.068507Z","title":"Scaling llm test-time compute opti- mally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.068507Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:e197812ef44660f46548da3f1c56fe26fe571cb9bf37e3b026c99f627d1a6e02","observation_id":"27aacc16-2829-4e1e-add6-8492ae44fff9","resolution":{"observed_at":"2026-08-16T12:37:04.068507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.04006","last_updated":"2020-11-08T15:53:56Z","snapshot_observed_at":"2026-08-20T00:13:57.716002Z","submitted_at":"2020-11-08T15:53:56Z","title":"Long Range Arena: A Benchmark for Efficient Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.04006","snapshot_observed_at":"2026-08-16T12:37:04.071767Z","title":"Long range arena: A benchmark for efficient transformers","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.071767Z"},"links":{"cited_paper":"/paper/2011.04006","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:79a13252f071660affc1193e798be6c7017288df7c7c9a536f39e76c0f6182d7","observation_id":"a2d4a028-50d7-462e-80ca-527980c6313a","resolution":{"observed_at":"2026-08-16T12:37:04.071767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-16T12:37:04.075179Z","title":null,"venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.075179Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:b995ff913b6499d854dd333b99234c6f36598c214e045ddbef705c8f3800761a","observation_id":"d5e8d15e-c0ae-4b61-ab3b-2860aed233cd","resolution":{"observed_at":"2026-08-16T12:37:04.075179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-08-19T04:31:12.196632Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-16T12:37:04.081633Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.081633Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:1f05af30ab83ddc6400bedeb6d7182d1fcd0d12d76d33a02511cdb03ec0f2282","observation_id":"ba2c33e5-8ccb-482f-acaa-be2949a91614","resolution":{"observed_at":"2026-08-16T12:37:04.081633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:37:04.391533Z","title":"memory trade-off and comparing them with other optimization methods","venue":null,"work_id":"86b320a2-79f6-4fb8-91c8-a51c974b1c1b","year":2024},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.085148Z"},"links":{"citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:334500c8969a06988ab3607cb0cbf2fa2383a06ac11301ee3e4fb9690132f17f","observation_id":"ae10ed15-d64d-4be1-a0c2-6458c89b49d0","resolution":{"observed_at":"2026-08-16T12:37:04.396971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-16T12:37:04.011426Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.011426Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:ce22dbdc1a8f0934e203e837246fb4a8811ab3eb601eb2778f336c4c0ed2086c","observation_id":"ca4520ef-3c55-4e33-a5a8-b43c43f49046","resolution":{"observed_at":"2026-08-16T12:37:04.011426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.04768","snapshot_observed_at":"2026-08-16T12:37:04.078418Z","title":"Linformer: Self- attention with linear complexity","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.078418Z"},"links":{"cited_paper":"/paper/2006.04768","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:aba7686c4116eb36d59285d38b72166e9ede0f69c1795566c9894971c3e75ef1","observation_id":"2f060934-ee4f-4f57-961a-63c084e61d25","resolution":{"observed_at":"2026-08-16T12:37:04.078418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-16T12:37:04.061666Z","title":"Under review","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.061666Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:3fbf9f41e49612acdd613baffa4db7c33679a77cb030cde037d83c3f7f73d34f","observation_id":"28264a83-f247-4924-bce6-06ced3814f1f","resolution":{"observed_at":"2026-08-16T12:37:04.061666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09078","last_updated":"2025-04-01T12:48:43Z","snapshot_observed_at":"2026-08-16T19:00:33.294322Z","submitted_at":"2024-12-12T09:01:18Z","title":"Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09078","snapshot_observed_at":"2026-08-16T12:37:03.999936Z","title":"Forest-of-thought: Scaling test-time compute for enhancing llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:03.999936Z"},"links":{"cited_paper":"/paper/2412.09078","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:08d8f84b0448abb956e138dc52392df2ea7ee2bfdc467d4feded37fb600e6bb9","observation_id":"fd908b79-eb89-499d-a733-b4dd6ed87520","resolution":{"observed_at":"2026-08-16T12:37:03.999936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.05682","last_updated":"2022-10-10T16:36:47Z","snapshot_observed_at":"2026-08-18T08:33:42.893303Z","submitted_at":"2021-12-10T17:25:07Z","title":"Self-attention Does Not Need $O(n^2)$ Memory","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.05682","snapshot_observed_at":"2026-08-16T12:37:04.047412Z","title":"Samyam Rajbhandari, Jeff Rasley, Olatunji Ruwase, and Yuxiong He","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.047412Z"},"links":{"cited_paper":"/paper/2112.05682","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:3f0b428638f113760adbc0c7e009ddc4e5f1658cbb9e1fa4e25c61f3332ecc7e","observation_id":"778f4d91-b6fd-4c0a-8ccd-82a4b4287482","resolution":{"observed_at":"2026-08-16T12:37:04.047412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-16T12:37:04.014973Z","title":"Accessed: 2025-03-25","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.014973Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:630db41ebfdbbf70bfd434df8b43e7d1b4db2a004751bfb467d781caf8756c3b","observation_id":"dcd9a9c8-1f30-4078-8947-a73970720cf9","resolution":{"observed_at":"2026-08-16T12:37:04.014973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-16T12:37:03.984847Z","title":"Mistral AI and NVIDIA","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:03.984847Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:d2ccc56d8a5aa38960902910f8893e35b386f85ee7ea5ccf853d6067a4ace82b","observation_id":"18839c6e-1293-4833-a060-f1e522083534","resolution":{"observed_at":"2026-08-16T12:37:03.984847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12574","last_updated":"2025-02-18T06:26:05Z","snapshot_observed_at":"2026-08-16T12:57:27.154019Z","submitted_at":"2025-02-18T06:26:05Z","title":"HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12574","snapshot_observed_at":"2026-08-16T12:37:04.036729Z","title":"Headinfer: Memory-efficient llm inference by head-wise offloading","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-16T12:37:04.036729Z"},"links":{"cited_paper":"/paper/2502.12574","citing_paper":"/paper/2504.12526"},"observation_digest":"sha256:0ff1b36136ae2014ff4e8c632cc9bdbfaa29e454c1ed74d252658e6e4f5ebd2b","observation_id":"6443fef6-db0f-4bf6-bb6f-ff150fa05b4e","resolution":{"observed_at":"2026-08-16T12:37:04.036729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.12526","last_updated":"2025-04-16T23:15:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T00:14:29.755524Z","submitted_at":"2025-04-16T23:15:09Z","title":"MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2504.12526."}