{"as_of":"2026-08-08T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14a75a7b8bf79345d7988b5d1736a1ed8ee50fc69f8132b3b79755733b1559d7","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:13:28.835572Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:18:54.163862Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:47:59.879253Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"cited_work":{"arxiv_id":"2505.22425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22425","snapshot_observed_at":"2026-07-03T09:47:59.879253Z","title":"Scaling reasoning without attention","venue":null,"work_id":"f934bbdf-5415-4a38-891a-acbf9062586b","year":2025},"citing_paper":{"arxiv_id":"2507.11687","last_updated":"2026-04-20T02:18:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-15T19:44:20Z","title":"MetaLint: Easy-to-Hard Generalization for Code Linting","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-19T04:07:31.283348Z"},"links":{"cited_paper":"/paper/2505.22425","citing_paper":"/paper/2507.11687"},"observation_digest":"sha256:7e77f66934757e9c59596e0f283d0dd5bc36aa11bee702c1729fd308adc3497b","observation_id":"38fd6968-c2b3-4337-9c67-ebb554f29524","resolution":{"observed_at":"2026-05-19T04:12:02.876223Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"cited_work":{"arxiv_id":"2505.22425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.22425","snapshot_observed_at":"2026-07-03T09:47:59.879253Z","title":"Scaling reasoning without attention","venue":null,"work_id":"f934bbdf-5415-4a38-891a-acbf9062586b","year":2025},"citing_paper":{"arxiv_id":"2606.11634","last_updated":"2026-06-10T03:56:03Z","snapshot_observed_at":"2026-08-02T13:37:43.737297Z","submitted_at":"2026-06-10T03:56:03Z","title":"Architecture-Aware Reinforcement Learning Makes Sliding-Window Attention Competitive in Math Reasoning","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-06-27T10:18:54.163862Z"},"links":{"cited_paper":"/paper/2505.22425","citing_paper":"/paper/2606.11634"},"observation_digest":"sha256:8a390300d59d1ff8a34dac357d6832b555f2d910e1996e377b562a01e4354199","observation_id":"176b3fa8-1938-42be-a182-b772f314f799","resolution":{"observed_at":"2026-07-03T09:47:59.880509Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.22425/citation-record","integrity":"/paper/2505.22425/integrity","json":"/paper/2505.22425/citation-record.json","paper":"/paper/2505.22425"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T13:13:26.227804Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.227804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:e5be2ad5113143c97a1d79e5dd73b222d2ee3671b7b3ca5bb358a5252201ee2f","observation_id":"2e310493-4137-4ef4-ae9d-4c5f6eff8019","resolution":{"observed_at":"2026-08-07T13:13:26.227804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:26.415360Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.415360Z"},"links":{"citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:e81a945b8bdf4214e93ae92f0eddfec3db3ac111c93b75bc031f6c9f318b57f1","observation_id":"8cc3dbb4-c48c-4a46-a9f4-ec87798285cb","resolution":{"observed_at":"2026-08-07T13:13:26.415360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T13:13:26.648195Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.648195Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:1a7a302ad390bc91ebdfe7fe30b4153ad598e570c5d3848878dd540ecdf5e51a","observation_id":"9fc8e080-b323-42ca-86af-59ed924e7fd5","resolution":{"observed_at":"2026-08-07T13:13:26.648195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T13:13:26.740105Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.740105Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:a7fe2ac93db38e6809385bce6705228e4d5217306d9fb1a54278bf52447466fb","observation_id":"69b356c1-0c92-4468-8a44-12d431ded2d3","resolution":{"observed_at":"2026-08-07T13:13:26.740105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T13:13:26.815329Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.815329Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:8fec490a306ddae69826dce7827b607163ba0a3437c23325e24a8b487eb9870b","observation_id":"fd5febec-8819-4651-ae3e-7af956b07aed","resolution":{"observed_at":"2026-08-07T13:13:26.815329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07974","snapshot_observed_at":"2026-08-07T13:13:26.947907Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.947907Z"},"links":{"cited_paper":"/paper/2403.07974","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:9b3dfb30e9b12c1f593b5f9753831c809cb300cc28a3efe4c817b6c485d7dd91","observation_id":"709c1181-f750-43e5-a30e-b624d8459e01","resolution":{"observed_at":"2026-08-07T13:13:26.947907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:30.310294Z","title":"9 Aitor Lewkowycz, Anders Andreassen, David Dohan, Ethan Dyer, Henryk Michalewski, Vinay Ra- masesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, et al","venue":null,"work_id":"04c1d06d-41a7-4ff4-9295-f8a26e1d775d","year":2025},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.038519Z"},"links":{"citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:da7e713778c182c2ff6c31ac3a8c59cd6a51ea23b086176c78de43f7a1a964c8","observation_id":"c66d47db-93db-46ff-988f-a33b0611c00b","resolution":{"observed_at":"2026-08-07T13:13:30.398256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-07T13:13:27.137705Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.137705Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:ccd9a8307ae241bec580449f1ec6be051c196f357a1534a27507b8b2e9906372","observation_id":"1bab0e03-c8d6-4045-b22f-7be5514dbfe3","resolution":{"observed_at":"2026-08-07T13:13:27.137705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16891","last_updated":"2025-04-23T17:13:04Z","snapshot_observed_at":"2026-08-07T15:59:48.302908Z","submitted_at":"2025-04-23T17:13:04Z","title":"AIMO-2 Winning Solution: Building State-of-the-Art Mathematical Reasoning Models with OpenMathReasoning dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16891","snapshot_observed_at":"2026-08-07T13:13:27.227849Z","title":"Aimo-2 winning solution: Building state-of-the-art mathematical reasoning models with openmathreasoning dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.227849Z"},"links":{"cited_paper":"/paper/2504.16891","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:27b1b51ff6c19149746478fd4e81a06a7106089663f22fbcf6ad8a1a4be93ac7","observation_id":"64cbe68b-78ec-4b6c-a9c0-6af0de2e2f80","resolution":{"observed_at":"2026-08-07T13:13:27.227849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T13:13:27.340471Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.340471Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:0001ac1269e848abc28964459ba039673782052cecdd2096412d69c93a619093","observation_id":"c9926482-f297-4aa8-b329-8cf8c955e4f4","resolution":{"observed_at":"2026-08-07T13:13:27.340471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T13:13:27.469238Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.469238Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:0311de90701b366123fa70774cd391b569ba36cd2d7eb2d23fd8a39343020893","observation_id":"ab333d8c-9054-4dee-be5f-ae0b0743df95","resolution":{"observed_at":"2026-08-07T13:13:27.469238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-02T13:21:32.251959Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-07T13:13:27.624874Z","title":"Retentive network: A successor to transformer for large language models.arXiv preprint arXiv:2307.08621,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.624874Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:18b84ef41947a1ac68face430211fe2d8a21bd50ed8bda85cce33c83e6775e94","observation_id":"bb416504-5ae1-4418-bd1e-c5e554c7af25","resolution":{"observed_at":"2026-08-07T13:13:27.624874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T13:13:27.735999Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.735999Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:7675af0ebd495669a0234096f5ced7eb000c58a06f6a93ef9466594527b8beba","observation_id":"5d3c91fc-0bb1-4550-a45f-cd0a3c0f3b01","resolution":{"observed_at":"2026-08-07T13:13:27.735999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10449","last_updated":"2025-09-09T04:52:25Z","snapshot_observed_at":"2026-08-07T16:05:47.222775Z","submitted_at":"2025-04-14T17:38:25Z","title":"M1: Towards Scalable Test-Time Compute with Mamba Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10449","snapshot_observed_at":"2026-08-07T13:13:27.861259Z","title":"NovaSky Team","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.861259Z"},"links":{"cited_paper":"/paper/2504.10449","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:eb1bcf7a02b3b563cf538a5b67da84eb88ea6bd19a40c096127e30fac004602f","observation_id":"6d6a2ed3-9257-4b80-8998-86bac1a0fbbb","resolution":{"observed_at":"2026-08-07T13:13:27.861259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T13:13:27.970162Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:27.970162Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:4798f1170049d5749771166d7005d27b25f70c4e0b0ee354c2c21a932fbc64fc","observation_id":"11a2ed28-ce7e-4a00-9c4d-92da4a5d57b2","resolution":{"observed_at":"2026-08-07T13:13:27.970162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-06T05:53:13.494942Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-07T13:13:28.091568Z","title":"Parallelizing linear transformers with the delta rule over sequence length","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.091568Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:25c05fd896d8fd348d782a47b270ff44dbf74287dd5583246f069723ed86f492","observation_id":"232cce74-e538-4a71-8cb9-6ad92e78a480","resolution":{"observed_at":"2026-08-07T13:13:28.091568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-07T13:13:28.195543Z","title":"Mammoth: Building math generalist models through hybrid instruction tuning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.195543Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:be8baf9fdd87251657eb9467e3b1ab95fd2db7797893e652aeb3c0175c97eaec","observation_id":"49190441-b27f-4683-bd0b-ae4a2a8fc160","resolution":{"observed_at":"2026-08-07T13:13:28.195543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.03548","last_updated":"2024-05-23T16:34:35Z","snapshot_observed_at":"2026-08-06T17:52:58.973060Z","submitted_at":"2024-05-06T15:11:38Z","title":"MAmmoTH2: Scaling Instructions from the Web","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.03548","snapshot_observed_at":"2026-08-07T13:13:28.299855Z","title":"Mammoth2: Scaling instructions from the web","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.299855Z"},"links":{"cited_paper":"/paper/2405.03548","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:8a7e334c790f4c41f3ad9aa1b656e2c30730d34bfdd26dc7dfdee7960829d718","observation_id":"cf98c9ff-b42a-496e-9dde-b54d27aff825","resolution":{"observed_at":"2026-08-07T13:13:28.299855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12960","last_updated":"2023-10-19T17:56:40Z","snapshot_observed_at":"2026-07-06T16:35:48.413898Z","submitted_at":"2023-10-19T17:56:40Z","title":"SEGO: Sequential Subgoal Optimization for Mathematical Problem-Solving","version":1},"cited_work":{"arxiv_id":"2310.12960","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.12960","snapshot_observed_at":"2026-08-07T13:13:29.203918Z","title":"SEGO: Sequential Subgoal Optimization for Mathematical Problem-Solving","venue":"cs.CL","work_id":"6ff808a7-21ac-4752-8951-f4a1d37e786b","year":2023},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.389604Z"},"links":{"cited_paper":"/paper/2310.12960","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:9b80759fa61a04be636b6becfaa5a14b824c1e8fca2f946fb02dbca83f05de48","observation_id":"a25caafe-4ae7-4836-a253-4895d8bf899e","resolution":{"observed_at":"2026-08-07T13:13:29.309591Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11172","last_updated":"2024-08-20T20:10:53Z","snapshot_observed_at":"2026-08-04T23:58:13.073385Z","submitted_at":"2024-08-20T20:10:53Z","title":"SubgoalXL: Subgoal-based Expert Learning for Theorem Proving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11172","snapshot_observed_at":"2026-08-07T13:13:28.536244Z","title":"Subgoalxl: Subgoal-based expert learning for theorem proving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.536244Z"},"links":{"cited_paper":"/paper/2408.11172","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:6b51a967fcb3c555cf2d42917cc1a16a1cb1789189dda4f64d57bd93cdd66e0d","observation_id":"fb20beab-3a9c-40c7-b91c-7a9042483b9c","resolution":{"observed_at":"2026-08-07T13:13:28.536244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:13:28.644116Z","title":"Promptcot: Synthesizing olympiad-level problems for mathematical reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.644116Z"},"links":{"citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:9fe2c8228647b81c9b7ea7b02a7c984b62b3c0745d8cfc819bd102e43be05ff8","observation_id":"de3232c6-d290-402a-ba76-56aadcff66ee","resolution":{"observed_at":"2026-08-07T13:13:28.644116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04542","last_updated":"2023-02-09T10:16:20Z","snapshot_observed_at":"2026-08-07T01:44:39.930926Z","submitted_at":"2023-02-09T10:16:20Z","title":"Efficient Attention via Control Variates","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04542","snapshot_observed_at":"2026-08-07T13:13:28.758966Z","title":"Efficient attention via control variates","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.758966Z"},"links":{"cited_paper":"/paper/2302.04542","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:54aa17c0255d1beac1e77091bf4919242c4fbc49d8f5fd13891651dd13ae98a4","observation_id":"8832bc9f-8306-48f5-bb41-1d515f79f604","resolution":{"observed_at":"2026-08-07T13:13:28.758966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10625","last_updated":"2023-04-16T22:08:08Z","snapshot_observed_at":"2026-08-06T09:00:42.886249Z","submitted_at":"2022-05-21T15:34:53Z","title":"Least-to-Most Prompting Enables Complex Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10625","snapshot_observed_at":"2026-08-07T13:13:28.835572Z","title":"Least-to-most prompting enables complex reasoning in large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.835572Z"},"links":{"cited_paper":"/paper/2205.10625","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:5c136a69986e0aaba1022130d2c7aabacbf4a5835bd75e1ed0382e6a4e8c66c9","observation_id":"069d62ff-3531-4f02-a1b6-9827a79ec468","resolution":{"observed_at":"2026-08-07T13:13:28.835572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T13:13:26.496858Z","title":"Evaluating large language models trained on code","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.496858Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:70817697a8bf73d0e82eb211d91bc8b2c26103c9afbcaf27d75d8b91c9aa6d9a","observation_id":"946022f1-e3eb-409b-a108-8f113b4e3add","resolution":{"observed_at":"2026-08-07T13:13:26.496858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T13:13:26.876946Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.876946Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:bf39df404ef94192cb39379cefdf6027c65f5a93ababbc453d1a1a8189d997ad","observation_id":"377417d6-7b14-47eb-95d5-5826c4681d22","resolution":{"observed_at":"2026-08-07T13:13:26.876946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-07T13:13:28.038685Z","title":"Gated linear attention transformers with hardware-efficient training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:28.038685Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:a712fa4bc72bad84410d28eda61cdc3f71dc1bf54e369cf3c5709ccdd8518544","observation_id":"0379efc3-ba6b-4810-8651-41a7ca3c7fc3","resolution":{"observed_at":"2026-08-07T13:13:28.038685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01943","last_updated":"2025-08-07T23:04:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-02T17:50:31Z","title":"OpenCodeReasoning: Advancing Data Distillation for Competitive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01943","snapshot_observed_at":"2026-08-07T13:13:26.292420Z","title":"Opencodereasoning: Advancing data distillation for competitive coding","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.292420Z"},"links":{"cited_paper":"/paper/2504.01943","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:1d5f4cd08f5c36c0ff9923106c42d3007754540a74074285902d3138ca25348d","observation_id":"f7c5e5c4-6f0a-43ba-9152-fe1d4437403c","resolution":{"observed_at":"2026-08-07T13:13:26.292420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-07T13:13:26.570912Z","title":"mlr.press/v235/dao24a.html","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.570912Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:862e03b08d37ac19119ced86b286c434640ebfc30cd88f70f0937123f879d173","observation_id":"48ba9ba7-0e97-42a7-afe2-ebc9327e91a6","resolution":{"observed_at":"2026-08-07T13:13:26.570912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-07T16:08:37.984756Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-07T13:13:26.357993Z","title":"https://huggingface.co/datasets/ai-mo/aimo-validation-aime","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T13:13:26.357993Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2505.22425"},"observation_digest":"sha256:2952bb3a13ad7776c8a9f9639e3f25f4f4a8150c3d39058bd6226faa1494fea9","observation_id":"ea777f1a-5425-4c36-a710-89fe317673d3","resolution":{"observed_at":"2026-08-07T13:13:26.357993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.22425","last_updated":"2025-05-28T14:52:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T13:05:12.273062Z","submitted_at":"2025-05-28T14:52:15Z","title":"Scaling Reasoning without Attention"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":1},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 2 inbound Pith citation observations for arXiv:2505.22425."}