{"as_of":"2026-08-18T12:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:792326d3ce93a3948c9b6329368b1588a58421d1b0561470ab2a53b6098c5d4c","coverage":[{"denominator":63,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":63,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:40:27.825037Z","state":"measured"},{"denominator":67,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":67,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T07:31:30.334937Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T07:43:11.766620Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":"2504.14992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient pretraining length scaling","venue":null,"work_id":"c76b2922-66dd-4765-bebc-a1156d708d6c","year":2025},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-13T23:04:32.343355Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T07:43:11.620446Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:3d19c01e5df354c94f2bb9fdff2faf7f7cd06828be85f4911a154a7cf5aa7a4b","observation_id":"9e028773-dd76-486a-a7fa-06f751cc643f","resolution":{"observed_at":"2026-05-15T07:43:11.770485Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-08-04T07:31:30.334937Z","title":"Efficient pretraining length scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.25741","last_updated":"2026-07-01T23:25:58Z","snapshot_observed_at":"2026-08-13T23:04:32.343355Z","submitted_at":"2025-10-29T17:45:42Z","title":"Scaling Latent Reasoning via Looped Language Models","version":5},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T07:31:30.334937Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2510.25741"},"observation_digest":"sha256:626d02245ea44870c1897a4fce53aaadd61382109cc751e2db13bfda1202d478","observation_id":"b3c40fe4-0676-45ed-83ed-00fe7703e31f","resolution":{"observed_at":"2026-08-04T07:31:30.334937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-07-13T14:03:01.974171Z","title":"Efficient pretraining length scaling.CoRR, abs/2504.14992, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.02029","last_updated":"2026-06-05T06:21:20Z","snapshot_observed_at":"2026-07-30T23:04:23.206455Z","submitted_at":"2026-04-02T13:36:37Z","title":"The Latent Space: Foundation, Evolution, Mechanism, Ability, and Outlook","version":2},"reference_index":235,"source":"pdf_text","source_observed_at":"2026-07-13T14:03:01.974171Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2604.02029"},"observation_digest":"sha256:7a0d24c4b88149dadd797feddaaa32c9d6035a91c70b48b4b38e87c6d483a50f","observation_id":"7003648e-fb23-457e-9306-e412ae4fdc60","resolution":{"observed_at":"2026-07-13T14:03:01.974171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"cited_work":{"arxiv_id":"2504.14992","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14992","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient pretraining length scaling","venue":null,"work_id":"c76b2922-66dd-4765-bebc-a1156d708d6c","year":2025},"citing_paper":{"arxiv_id":"2605.09630","last_updated":"2026-05-10T16:18:22Z","snapshot_observed_at":"2026-08-14T10:03:16.402043Z","submitted_at":"2026-05-10T16:18:22Z","title":"Scratchpad Patching: Decoupling Compute from Patch Size in Byte-Level Language Models","version":1},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-12T04:05:28.713898Z"},"links":{"cited_paper":"/paper/2504.14992","citing_paper":"/paper/2605.09630"},"observation_digest":"sha256:9772f91267f321290a8e223c405e28d673ed2d17b3ae25582b2a365cd1c3bb54","observation_id":"f683faf2-3189-4eec-9029-366a612255d5","resolution":{"observed_at":"2026-05-12T06:36:29.285778Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14992/citation-record","integrity":"/paper/2504.14992/integrity","json":"/paper/2504.14992/citation-record.json","paper":"/paper/2504.14992"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-16T11:40:27.558018Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.558018Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2af896010cb4745160d0a3477ad4fe0bb911fc0ed32ef058361c685c01288a59","observation_id":"2a495a46-b68e-4c72-b08b-8ed75d565a47","resolution":{"observed_at":"2026-08-16T11:40:27.558018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.563405Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.563405Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1c161a4678112e299d8dfc800d00971c379f408436d0d521ee8bb607528f120e","observation_id":"37f726f6-5bd4-452b-b1ee-51c5db3e5e8e","resolution":{"observed_at":"2026-08-16T11:40:27.563405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-16T11:40:27.567873Z","title":"Peters, and Arman Cohan","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.567873Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:9aef199057558928a640cfdc1619538d433e07112d6be2339f1b594dae378228","observation_id":"15b54ffb-3f76-4735-b1f1-a3cc8cfe9928","resolution":{"observed_at":"2026-08-16T11:40:27.567873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.572503Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.572503Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1a157146d83dde8be43826f91beaf35100a1966448ab4f657348803e09053355","observation_id":"36e29e45-f8e2-4088-83a9-6c5861deb028","resolution":{"observed_at":"2026-08-16T11:40:27.572503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09431","last_updated":"2023-11-15T23:01:02Z","snapshot_observed_at":"2026-08-17T19:29:18.923800Z","submitted_at":"2023-11-15T23:01:02Z","title":"Striped Attention: Faster Ring Attention for Causal Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09431","snapshot_observed_at":"2026-08-16T11:40:27.576790Z","title":"Striped attention: Faster ring attention for causal transformers.CoRR, abs/2311.09431, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.576790Z"},"links":{"cited_paper":"/paper/2311.09431","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:0c3e267a6042ecf4091f3e0048177d3c6bb6fbdad67f2782bb185c6c28397d4d","observation_id":"091c1abf-aee0-4067-8db9-777408e2aedd","resolution":{"observed_at":"2026-08-16T11:40:27.576790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10858","last_updated":"2024-09-27T08:03:07Z","snapshot_observed_at":"2026-08-16T13:42:36.305570Z","submitted_at":"2024-06-16T09:06:17Z","title":"Step-level Value Preference Optimization for Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10858","snapshot_observed_at":"2026-08-16T11:40:27.581679Z","title":"Step-level value preference optimization for mathematical reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.581679Z"},"links":{"cited_paper":"/paper/2406.10858","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:8b37539e82e2d8f8ccbb074289567778a5dffb9782a17c3e4b0949954eb03c31","observation_id":"f0f1e1f3-92a8-43a5-b4ed-aa5dc82d590b","resolution":{"observed_at":"2026-08-16T11:40:27.581679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13842","last_updated":"2025-02-23T04:31:53Z","snapshot_observed_at":"2026-08-16T12:56:56.810802Z","submitted_at":"2025-02-19T16:02:23Z","title":"Inner Thinking Transformer: Leveraging Dynamic Depth Scaling to Foster Adaptive Internal Thinking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13842","snapshot_observed_at":"2026-08-16T11:40:27.586615Z","title":"Inner thinking transformer: Leveraging dynamic depth scaling to foster adaptive internal thinking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.586615Z"},"links":{"cited_paper":"/paper/2502.13842","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2f958fcaba1f52a918ae60952fed5ae461bb9dd0826aba595ba26c1a35e7fc46","observation_id":"a9ecf90b-d3f6-4c55-ae68-2d61dd38abc3","resolution":{"observed_at":"2026-08-16T11:40:27.586615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-16T10:03:03.268538Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-16T11:40:27.591194Z","title":"Generating long sequences with sparse transformers","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.591194Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:bcdd5a6a8b0257875588bdcde94c5d90c59038f230b457c62b6440ef056f7a4d","observation_id":"d98a2357-b202-48e5-ad30-4a0bf0bd91ea","resolution":{"observed_at":"2026-08-16T11:40:27.591194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.595724Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.595724Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:b5b36f9c07b283d65cabb6bf3af3a25c6025034ebcfe008fc4f9a7cabdf02d7b","observation_id":"b9e293a4-de22-4678-9395-6af6dcc67457","resolution":{"observed_at":"2026-08-16T11:40:27.595724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-16T11:40:27.599886Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.599886Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:3d2a950e3eef36df4477670a26a983002a869e29c61903dc3c695eca4fac667a","observation_id":"80048c91-2a95-4320-867c-e50c8cc87163","resolution":{"observed_at":"2026-08-16T11:40:27.599886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:40:27.604174Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.604174Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:0a2fa796d56f35643937601c7d0bec6990f35047525e0c99a55b8ce5189296ae","observation_id":"665c3ae4-19f4-4b9f-bc13-659ac7dbb42b","resolution":{"observed_at":"2026-08-16T11:40:27.604174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.812170Z","title":"Flashattention-2: Faster attention with better parallelism and work partitioning","venue":null,"work_id":"fdede0d6-e945-4166-9a1b-3ff17ad1f549","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.608654Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:8547e1a49ff8927fb7ab022466d282becb28125cdc00d2afd2cc10b5222da6c9","observation_id":"8a8c855b-09c9-45d8-a140-9ace5b336d3f","resolution":{"observed_at":"2026-08-16T11:40:28.816535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.798828Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":"9cf136b5-274b-4bc3-90d3-0e80031ffa06","year":2022},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.612738Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:83848f80a867b65a16259c4ec8df6c88cc685775af038ec60d81402382aa1bbc","observation_id":"c858dc2e-bee8-45ca-b2d5-c2fbc0795e09","resolution":{"observed_at":"2026-08-16T11:40:28.803359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.785570Z","title":"Flash-decoding for long-context inference, October","venue":null,"work_id":"78ba6b57-96b2-4f7c-ba5e-31377dd18e6b","year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.616727Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:014cc0413209f9697bac8a8d05286df35d68ce9f39aeb9c7172faf54acb26c66","observation_id":"a35e5cf4-34aa-4230-be4f-26896c2c47d0","resolution":{"observed_at":"2026-08-16T11:40:28.789928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02486","last_updated":"2023-07-19T12:25:35Z","snapshot_observed_at":"2026-08-16T15:18:27.962961Z","submitted_at":"2023-07-05T17:59:38Z","title":"LongNet: Scaling Transformers to 1,000,000,000 Tokens","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02486","snapshot_observed_at":"2026-08-16T11:40:27.624969Z","title":"Longnet: Scaling transformers to 1, 000, 000, 000 tokens","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.624969Z"},"links":{"cited_paper":"/paper/2307.02486","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:752eb522f82bc3a3d2d831d16798fde1ff447bca9d04e1220f83e99e55cd438c","observation_id":"0fcddfd9-b261-4dee-aa43-098683fe5ded","resolution":{"observed_at":"2026-08-16T11:40:27.624969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05171","last_updated":"2025-02-17T17:14:04Z","snapshot_observed_at":"2026-08-15T00:53:48.099058Z","submitted_at":"2025-02-07T18:55:02Z","title":"Scaling up Test-Time Compute with Latent Reasoning: A Recurrent Depth Approach","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05171","snapshot_observed_at":"2026-08-16T11:40:27.629386Z","title":"Scaling up test-time compute with latent reasoning: A recurrent depth approach","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.629386Z"},"links":{"cited_paper":"/paper/2502.05171","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:e43f2402f6e164d97b1cd63efd436bd9aba404762d651b5c8fa0308f0725e441","observation_id":"90fe73a9-05d6-4945-bf02-11a2bcb339ef","resolution":{"observed_at":"2026-08-16T11:40:27.629386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.759374Z","title":"Think before you speak: Training language models with pause tokens","venue":null,"work_id":"ba683c69-af94-43c0-a389-17e27c603cf2","year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.634029Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:31abf818c7efb089476434537d42e080d1dbebd1821f3d2aaa0a9de65fd40ca7","observation_id":"c26e4082-807b-40ae-a037-b99d19b14464","resolution":{"observed_at":"2026-08-16T11:40:28.763606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-16T11:40:27.638548Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.638548Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:e1d83d085cb226232758cc93dfbe03bad95fd9614746bc8f29e1ccf01475b08f","observation_id":"92849502-2711-40bf-ae22-62a82284aab2","resolution":{"observed_at":"2026-08-16T11:40:27.638548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00930","last_updated":"2024-04-01T05:19:34Z","snapshot_observed_at":"2026-08-16T14:04:44.801881Z","submitted_at":"2024-04-01T05:19:34Z","title":"PSYDIAL: Personality-based Synthetic Dialogue Generation using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00930","snapshot_observed_at":"2026-08-16T11:40:27.642741Z","title":"Psydial: personality-based synthetic dialogue generation using large language models.arXiv preprint arXiv:2404.00930, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.642741Z"},"links":{"cited_paper":"/paper/2404.00930","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:8908e645facf9fee09649916d929b66f5d74491b4fa8c56498776875b29930e7","observation_id":"3f7478eb-756e-4cf2-aecd-d02af900b175","resolution":{"observed_at":"2026-08-16T11:40:27.642741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06769","last_updated":"2025-11-03T00:53:34Z","snapshot_observed_at":"2026-08-17T06:12:37.525438Z","submitted_at":"2024-12-09T18:55:56Z","title":"Training Large Language Models to Reason in a Continuous Latent Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06769","snapshot_observed_at":"2026-08-16T11:40:27.646890Z","title":"Training large language models to reason in a continuous latent space.arXiv preprint arXiv:2412.06769, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.646890Z"},"links":{"cited_paper":"/paper/2412.06769","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:943412351d4cf560acf77236e55e340cf005a2a65c733501d7cbc358d0658c21","observation_id":"80155363-9798-4441-97c7-6b2949a45db3","resolution":{"observed_at":"2026-08-16T11:40:27.646890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T11:40:27.651372Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.651372Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:eac03d88fa4e6ce1c82a4125d9e81087599a637c5ebeed7ab1086cd313873f66","observation_id":"7afb1830-a59a-4eaf-b75e-33d7f4ffe78f","resolution":{"observed_at":"2026-08-16T11:40:27.651372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01293","last_updated":"2021-02-02T04:07:38Z","snapshot_observed_at":"2026-08-01T22:46:19.170916Z","submitted_at":"2021-02-02T04:07:38Z","title":"Scaling Laws for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.01293","snapshot_observed_at":"2026-08-16T11:40:27.655454Z","title":"Scaling laws for transfer.arXiv preprint arXiv:2102.01293, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.655454Z"},"links":{"cited_paper":"/paper/2102.01293","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:fd7ae456bd30b7853b4c3468ef78732d9447b688cc5e8e3bd94395d9220b4d52","observation_id":"209e70b9-66b9-4053-bb77-0f80cd91d6c9","resolution":{"observed_at":"2026-08-16T11:40:27.655454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01282","last_updated":"2024-01-05T12:41:13Z","snapshot_observed_at":"2026-08-16T14:46:31.226431Z","submitted_at":"2023-11-02T14:57:03Z","title":"FlashDecoding++: Faster Large Language Model Inference on GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01282","snapshot_observed_at":"2026-08-16T11:40:27.659632Z","title":"Flashdecoding++: Faster large language model inference on gpus.CoRR, abs/2311.01282, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.659632Z"},"links":{"cited_paper":"/paper/2311.01282","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:de6d03b77f3509a1bfddc21b844a63c690571683e22bab338f00183ce65dd748","observation_id":"f1b9f26b-e458-4b6f-9015-6ba6d282e343","resolution":{"observed_at":"2026-08-16T11:40:27.659632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:40:27.664264Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.664264Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f570f11e1382539518ddd001c80f66242b75bb664e5129ac384c4e05e8bbe0a4","observation_id":"163c4d11-ee79-453a-af08-6709b56dad43","resolution":{"observed_at":"2026-08-16T11:40:27.664264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.669416Z","title":"Minference 1.0: Accelerating pre-filling for long-context llms via dynamic sparse attention.Advances in Neural Information Processing Systems, 37:52481–52515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.669416Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2516a9e69c3ceb112ca469f5203ed32f3e4e6eaa9d04e3b34f402ce60605cee9","observation_id":"ca625383-aefd-4784-9ef3-633c5428580e","resolution":{"observed_at":"2026-08-16T11:40:27.669416Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.673545Z","title":"Longllmlingua: Accelerating and enhancing llms in long context scenarios via prompt compression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.673545Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:099efd759b6cb449fd08bf3b0b4e8dda272c74ceb951ae5b27e4c516ba0233fb","observation_id":"a06f4371-7320-412d-91cd-c08c3daec77f","resolution":{"observed_at":"2026-08-16T11:40:27.673545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06770","last_updated":"2024-11-11T23:05:04Z","snapshot_observed_at":"2026-08-18T08:11:45.716032Z","submitted_at":"2023-10-10T16:47:29Z","title":"SWE-bench: Can Language Models Resolve Real-World GitHub Issues?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06770","snapshot_observed_at":"2026-08-16T11:40:27.677625Z","title":"Swe-bench: Can language models resolve real-world github issues?arXiv preprint arXiv:2310.06770, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.677625Z"},"links":{"cited_paper":"/paper/2310.06770","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:91b41c6c056972f68c77aea72bce0bdbc7bf9f5c6cfd1bc4070b0c6acdee46d8","observation_id":"497d90ed-2ef1-463c-818a-3a55a1e04edd","resolution":{"observed_at":"2026-08-16T11:40:27.677625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T11:40:27.681973Z","title":"Scaling laws for neural language models.arXiv preprintarXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.681973Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:20f93dd869d89673b73bb009dac25af1194bdcc49c410be22605983418d83aee","observation_id":"7e232f65-c2fc-48fb-afb6-a44fe20f03a4","resolution":{"observed_at":"2026-08-16T11:40:27.681973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.686173Z","title":"Natural questions: a benchmark for question answering research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.686173Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:631dbd0f51d12ca2dceedf1fa8c7db436fdc29260cdd972708a25312ba5ae593","observation_id":"1a5ddb20-51a2-40f5-a640-73dd082d3a0f","resolution":{"observed_at":"2026-08-16T11:40:27.686173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.690438Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.690438Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:93111e4599630c11abfae55042d8c8fbad0d6e4c10808de006c1fa7f26451630","observation_id":"3437b068-4646-4092-950c-17ae22082461","resolution":{"observed_at":"2026-08-16T11:40:27.690438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-08-13T08:34:05.764059Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-16T11:40:27.694729Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.694729Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f45f177cbe7331137dac1fa6d1618aae84bf12868e635a7622978b1c6e5f2670","observation_id":"a9cee53b-3d09-4738-9c19-20f8869de968","resolution":{"observed_at":"2026-08-16T11:40:27.694729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-16T11:40:27.698916Z","title":"Snapkv: LLM knows what you are looking for before generation.CoRR, abs/2404.14469,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.698916Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1b8ecf146644c071308649d9bde4640329d3572c355e9f4719ebc15a6f22e8f7","observation_id":"31d8bb76-a3fe-4582-a07b-bc8dbe2f1d63","resolution":{"observed_at":"2026-08-16T11:40:27.698916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-16T11:40:27.708789Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model.arXiv preprint arXiv:2405.04434, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.708789Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:3ae7a62512ff6577f29413f38788a8134d717b6c69573c822b729b53c674d880","observation_id":"689cae58-4f74-4dae-b1f9-6d8c08e0d3ea","resolution":{"observed_at":"2026-08-16T11:40:27.708789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-16T11:40:27.713440Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.713440Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:1a240f5ce19fe0dfdfe6290d7fe3b93966c22f8356eb8826be5d86c7cd302ec3","observation_id":"e171f76d-316f-4c7e-ac7e-db93ce48ec98","resolution":{"observed_at":"2026-08-16T11:40:27.713440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-14T10:14:18.862721Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-16T11:40:27.717780Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.717780Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:bd3b53a70f9aa5913f99654b2609f6af8fcd64df51a13bcb6ccc6b77472e2f6a","observation_id":"b540b48a-e3b9-4079-bcf0-63075bde9b1f","resolution":{"observed_at":"2026-08-16T11:40:27.717780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.727866Z","title":"Cotformer: More tokens with attention make up for less depth","venue":null,"work_id":"acc194b8-0166-454a-9894-8a19c4c038f8","year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.722872Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:ee85982d967949b60ce09866c82f4a7b302197214b864048d280be64cc1e8b24","observation_id":"6970b460-588e-45a6-a150-d711cd57ba0a","resolution":{"observed_at":"2026-08-16T11:40:28.733667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00656","last_updated":"2025-10-08T07:50:45Z","snapshot_observed_at":"2026-08-17T13:58:40.683829Z","submitted_at":"2024-12-31T21:55:10Z","title":"2 OLMo 2 Furious","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00656","snapshot_observed_at":"2026-08-16T11:40:27.726822Z","title":"2 olmo 2 furious.arXiv preprint arXiv:2501.00656, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.726822Z"},"links":{"cited_paper":"/paper/2501.00656","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:ca11fe496d3bdd199cd8d39f70bde952c5e0ea81621eeaef74ddbae54d74aa51","observation_id":"10601342-b229-4e83-bc93-b1f013364f00","resolution":{"observed_at":"2026-08-16T11:40:27.726822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.730983Z","title":"Learning to reason with llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.730983Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2915d7df26ea44a11f782cf9738c6d7b61c106c55007cf8a323fae268e2285b5","observation_id":"cf7b5a91-4723-42d9-911b-62c308fbc876","resolution":{"observed_at":"2026-08-16T11:40:27.730983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.735013Z","title":"Learning to reason with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.735013Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:37675d1952c858e12a23749e2a3c94dc1074dbc6113a89ceb052f0ca88d3f8ae","observation_id":"e15b3320-6f79-4d74-be8f-d37b62ddbe0a","resolution":{"observed_at":"2026-08-16T11:40:27.735013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.738918Z","title":"Vicky Zhao, Lili Qiu, and Dongmei Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.738918Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d40d39697515c1ab1cbd50d94d857193940f46e74a306f387def234819b1e3e1","observation_id":"9e485649-1b75-42d9-b5bf-ab6eba06eb3f","resolution":{"observed_at":"2026-08-16T11:40:27.738918Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.742943Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.742943Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:97c369a0fb32ace8f722c16cb55ad063e5e7bf0e65c4ac3d9c0b4118d2979520","observation_id":"a340972b-df2c-4a84-a40c-c1ea645abdda","resolution":{"observed_at":"2026-08-16T11:40:27.742943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04985","last_updated":"2024-09-04T10:04:52Z","snapshot_observed_at":"2026-08-18T11:51:10.394119Z","submitted_at":"2023-12-08T11:47:35Z","title":"SparQ Attention: Bandwidth-Efficient LLM Inference","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04985","snapshot_observed_at":"2026-08-16T11:40:27.747393Z","title":"Sparq attention: Bandwidth-efficient llm inference.arXiv preprint arXiv:2312.04985, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.747393Z"},"links":{"cited_paper":"/paper/2312.04985","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:da86f0a43c819b455eea77dc20181260fb17e20cc0811f792a30b5ddb0a30399","observation_id":"e4498814-6522-4633-b142-e43347dd63db","resolution":{"observed_at":"2026-08-16T11:40:27.747393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.751446Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.751446Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:eeea31002da0c786582a0818bb80398d6c3a9d31cc6417a28b268bcdf10d5f18","observation_id":"91e7e568-39a5-4459-84a7-f28fa8143952","resolution":{"observed_at":"2026-08-16T11:40:27.751446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-16T11:40:27.755193Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.755193Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:72d78df6b1de629eb11c66b7733ef5bd30e6322b421c84a0fa7d0e5d8e335840","observation_id":"942dcaf6-5bca-4dae-a22d-3cede4caf60c","resolution":{"observed_at":"2026-08-16T11:40:27.755193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08608","last_updated":"2024-07-12T22:15:02Z","snapshot_observed_at":"2026-08-16T11:15:38.109255Z","submitted_at":"2024-07-11T15:44:48Z","title":"FlashAttention-3: Fast and Accurate Attention with Asynchrony and Low-precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08608","snapshot_observed_at":"2026-08-16T11:40:27.759136Z","title":"Flashattention-3: Fast and accurate attention with asynchrony and low-precision.CoRR, abs/2407.08608, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.759136Z"},"links":{"cited_paper":"/paper/2407.08608","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:d4df3a32b0d2e8c8e30c7cbac9079c6520b96322c7116464437bad15d24314d5","observation_id":"5ae0e7c7-7d5d-4826-8039-6c42aebce566","resolution":{"observed_at":"2026-08-16T11:40:27.759136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T11:40:27.763275Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.763275Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:6467797b23d9515da3ab5a79b7975d0408f082afd4168a746ae17c7da71c3c97","observation_id":"a1ac3a2b-439b-4ba0-b529-fe90cf13ed15","resolution":{"observed_at":"2026-08-16T11:40:27.763275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.672419Z","title":"Sparsebert: Rethinking the importance analysis in self-attention","venue":null,"work_id":"d73775a0-caeb-4d2d-9ae6-13c2ed670af2","year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.767431Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2cf1ded23c292491f0d7794c6e6ebd642694a04d250a21a7a68af23529608eca","observation_id":"cdf1eecf-8b62-4f5e-81d5-ed42dee80707","resolution":{"observed_at":"2026-08-16T11:40:28.676571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.08524","last_updated":"2025-02-12T16:00:11Z","snapshot_observed_at":"2026-08-14T07:35:42.261374Z","submitted_at":"2025-02-12T16:00:11Z","title":"LLM Pretraining with Continuous Concepts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.08524","snapshot_observed_at":"2026-08-16T11:40:27.771507Z","title":"Llm pretraining with continuous concepts.arXiv preprint arXiv:2502.08524, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.771507Z"},"links":{"cited_paper":"/paper/2502.08524","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:df6cb22936da1a41a361a06c11937914f766667b92bdef42dbc7cd9b29d97631","observation_id":"ffa160b7-62b5-4451-9cee-ba8cc6e5f20b","resolution":{"observed_at":"2026-08-16T11:40:27.771507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-14T18:05:06.623407Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-16T11:40:27.775667Z","title":"Commonsenseqa: A question answering challenge targeting commonsense knowledge.arXiv preprint arXiv:1811.00937, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.775667Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:aef41525502167ee30398cc353e9bcefe4cf855986bce1c5f929183cae323b37","observation_id":"9651b31e-bf8a-4581-8fe1-d93d9bb3bc07","resolution":{"observed_at":"2026-08-16T11:40:27.775667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.659110Z","title":"Quest: Query-aware sparsity for efficient long-context llm inference","venue":null,"work_id":"f58a50af-36d9-417d-856e-fed2139bc5d5","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.780307Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:0bc8761f8f8ecb5d78e46371db375cec9a65571decc99afba3a89776eeec1549","observation_id":"62ff530d-9287-492f-8f52-d4e11f830858","resolution":{"observed_at":"2026-08-16T11:40:28.663361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-16T11:40:27.784477Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.784477Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:bc546212b3b0fc9f746a0b0f104d1de38acda436813d0ca25f938d069b1ab53b","observation_id":"9cf96c16-855e-49a5-a497-93f7bf9a3a39","resolution":{"observed_at":"2026-08-16T11:40:27.784477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-08-14T18:15:53.516440Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-16T11:40:27.788641Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.arXiv preprint arXiv:2403.05530, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.788641Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:942736bc5c09c720021e8aabfc55ef3098f406f25e567512006cd37b3de66d15","observation_id":"f878e569-4991-4ae0-9492-22124a6c8e85","resolution":{"observed_at":"2026-08-16T11:40:27.788641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.792728Z","title":"Spatten: Efficient sparse attention architecture with cascade token and head pruning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.792728Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:fc004b2770c9cce3b5ebccf62ab5ae8a73b38bf528e2edbc2b79ab125cbee72c","observation_id":"d7008f2f-ee9d-4ac4-906b-d724213ddca8","resolution":{"observed_at":"2026-08-16T11:40:27.792728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.796755Z","title":"Openhands: An open platform for ai software developers as generalist agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.796755Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f8e36f0b6714bedb444ee7ca4d2972ef44d86ab39082a2090c1be7a97be12404","observation_id":"087072a8-55d2-4a7f-9dfd-b557ca3f5767","resolution":{"observed_at":"2026-08-16T11:40:27.796755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:27.800794Z","title":"Chain-of-thought prompting elicits reasoning in large language models.Advancesin neural information processing systems, 35:24824–24837, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.800794Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:611e1aac18d77dc202dc59c3ab23e97c2db0e09683e9b912506d1dbd3a1513c4","observation_id":"506aa59f-7d7a-4a29-8cb5-61cd03e2d6d7","resolution":{"observed_at":"2026-08-16T11:40:27.800794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.629445Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"78611350-49be-4904-b159-c505b14891b0","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.804971Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:a21f1dd88f862adb666ce31abea4cd9a0191d66b51fe51698bb64e5389b3edef","observation_id":"b9b29f29-a0e1-4ad3-af00-201c0d2f4ad6","resolution":{"observed_at":"2026-08-16T11:40:28.633681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.11089","last_updated":"2025-02-27T09:01:21Z","snapshot_observed_at":"2026-08-16T16:29:35.500686Z","submitted_at":"2025-02-16T11:53:44Z","title":"Native Sparse Attention: Hardware-Aligned and Natively Trainable Sparse Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.11089","snapshot_observed_at":"2026-08-16T11:40:27.808920Z","title":"Native sparse attention: Hardware-aligned and natively trainable sparse attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.808920Z"},"links":{"cited_paper":"/paper/2502.11089","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:9f5259be317dfb9ead69c4cb1a7859231fc2c32d0624a73a77224d5b588bc2a1","observation_id":"742911d0-84db-4836-a71b-037ca41da3bb","resolution":{"observed_at":"2026-08-16T11:40:27.808920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.615718Z","title":"Big bird: Transformers for longer sequences","venue":null,"work_id":"15a9d757-f8af-4b3b-91fc-bc59824f65b9","year":2020},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.813063Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:de46243e26a52f8171ee6e52bb84165ae8346ebd9cf7eb2e3f2e88e334e1169a","observation_id":"2cb9823b-4fc8-4f12-bf00-ca70efdd8d24","resolution":{"observed_at":"2026-08-16T11:40:28.620016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.601562Z","title":"Quiet-star: Language models can teach themselves to think before speaking","venue":null,"work_id":"6395459b-fc49-44c7-904e-da6edd67725b","year":2024},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.816971Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:8520042a962d852c2f5870680cf15f3310ff722f5b5cdc9622583aecbfce6e76","observation_id":"fccd7f9e-4885-43b9-83c7-359895c4e452","resolution":{"observed_at":"2026-08-16T11:40:28.606051Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-15T09:37:44.321271Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-16T11:40:27.820980Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.820980Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:2f8ebc3cabfd45a5695c6068831004f44eeee9828cd3596de54308d1797cf46e","observation_id":"d34e39bc-7abd-4d54-8354-81e1d36388c6","resolution":{"observed_at":"2026-08-16T11:40:27.820980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.585870Z","title":"H2o: Heavy-hitter oracle for efficient generative inference of large language models","venue":null,"work_id":"67793106-3755-4e88-8292-e8032ed3351b","year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.825037Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:f587e0d17867e1015857dbdda845e8711cf7fa06427c1139c12008f4aabc05a0","observation_id":"41be79ca-507e-42dd-9121-b032ca2660bb","resolution":{"observed_at":"2026-08-16T11:40:28.592405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:40:28.772852Z","title":"Accessed: 2024-9-29","venue":null,"work_id":"a018487e-e8f5-47cd-a31c-fd2acf48a0aa","year":2023},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.621049Z"},"links":{"citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:4298ec5536e76eaf4bc9363507ec68de52574a99accc6f5261bf558c5e96fa9a","observation_id":"100ce4b3-c7de-4b4b-953b-e3426844ab92","resolution":{"observed_at":"2026-08-16T11:40:28.776898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14469","last_updated":"2024-06-17T03:01:58Z","snapshot_observed_at":"2026-08-14T12:21:04.886717Z","submitted_at":"2024-04-22T17:42:58Z","title":"SnapKV: LLM Knows What You are Looking for Before Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14469","snapshot_observed_at":"2026-08-16T11:40:27.704329Z","title":"URL https://doi.org/10.48550/arXiv.2404.14469","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T11:40:27.704329Z"},"links":{"cited_paper":"/paper/2404.14469","citing_paper":"/paper/2504.14992"},"observation_digest":"sha256:0e3227e4b1ae5fcc8664f3e27806e09c780be252858ffbd46e2d9506e74339e1","observation_id":"2cbdfd7b-e0f9-45b7-95e4-990a0b58189b","resolution":{"observed_at":"2026-08-16T11:40:27.704329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.14992","last_updated":"2025-04-24T04:13:49Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T09:07:23.317188Z","submitted_at":"2025-04-21T09:41:26Z","title":"Efficient Pretraining Length Scaling"},"reference_resolution":{"displayed":63,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":63},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 63 of 63 outbound references and 4 inbound Pith citation observations for arXiv:2504.14992."}