{"as_of":"2026-08-08T19:30:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:78e5f4dcbdd0b95c6a5ea9bfbb0e99c5f9b81a1a30b8a2cfc470778a52c55a47","coverage":[{"denominator":50,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":50,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:05:19.897437Z","state":"measured"},{"denominator":50,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":50,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.17153/citation-record","integrity":"/paper/2505.17153/integrity","json":"/paper/2505.17153/citation-record.json","paper":"/paper/2505.17153"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-07T15:05:15.863753Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models, April 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.863753Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:c0e255ee497a0f1823fe62ddea9ad9eb0787efc9057a410e4f06646135b97293","observation_id":"edcb3ecf-1ee1-4680-b786-1a5fbc0e4f94","resolution":{"observed_at":"2026-08-07T15:05:15.863753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T15:05:15.912119Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.912119Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:0bb55c687b3b6902d293e0bca02ee4ff702497c466347d07ca0fd9dd70f45d5e","observation_id":"20594c8e-cf54-4b7b-ab41-0c971e689852","resolution":{"observed_at":"2026-08-07T15:05:15.912119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:05:15.978469Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:15.978469Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:b151b47851396494a4837185ed543417db45d6a839a37b8c5b2862bf6e8669eb","observation_id":"b8411c99-df34-483a-89a1-76374c5d0616","resolution":{"observed_at":"2026-08-07T15:05:15.978469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.14680","last_updated":"2022-10-12T18:01:23Z","snapshot_observed_at":"2026-08-03T05:22:23.916601Z","submitted_at":"2022-03-28T12:26:00Z","title":"Transformer Feed-Forward Layers Build Predictions by Promoting Concepts in the Vocabulary Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.14680","snapshot_observed_at":"2026-08-07T15:05:16.094881Z","title":"Transformer feed-forward layers build predictions by promoting concepts in the vocabulary space","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.094881Z"},"links":{"cited_paper":"/paper/2203.14680","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:7c081590ad895420ea3458ff41c9cf3deb15a07ebdd5a4a0b2f59a77b040e7bf","observation_id":"2451d7b6-0fb5-48dc-b271-06680e0039ec","resolution":{"observed_at":"2026-08-07T15:05:16.094881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:22.032805Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","venue":null,"work_id":"b20e20cb-803c-47ab-9fef-34935ca4fd72","year":2021},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.177248Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:9a114fc9006f312f6dc28b0964a7aee92d30c550985271e0177a505d8411e455","observation_id":"9fee41cc-b67c-4220-a614-8d07141047c6","resolution":{"observed_at":"2026-08-07T15:05:22.099888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:05:16.248909Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.248909Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:9a445640ca9684d2f65b2fc304db582d609fc646115719c456319d60fb1313db","observation_id":"3da8ab7f-1a4b-4b33-9fc6-607cd275d8a9","resolution":{"observed_at":"2026-08-07T15:05:16.248909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14608","last_updated":"2024-09-16T02:54:50Z","snapshot_observed_at":"2026-08-04T09:07:42.158421Z","submitted_at":"2024-03-21T17:55:50Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14608","snapshot_observed_at":"2026-08-07T15:05:16.333308Z","title":"Parameter-Efficient Fine-Tuning for Large Models: A Comprehensive Survey, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.333308Z"},"links":{"cited_paper":"/paper/2403.14608","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:84267c789d2ff1be96b435c61a3c05161d8d6b5f1546941d8fae1e12bc1e4f41","observation_id":"27bac971-3325-41f3-a048-39aeb616320d","resolution":{"observed_at":"2026-08-07T15:05:16.333308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-07T15:05:16.407357Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.407357Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:678bd160f89e13edfed7dac6af0e5dc147bdca3c508cbf6fd37ad84ccf42c4b2","observation_id":"091fe990-b33c-4595-91bd-3a51ae940bd7","resolution":{"observed_at":"2026-08-07T15:05:16.407357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.04284","last_updated":"2022-11-10T12:48:10Z","snapshot_observed_at":"2026-08-07T23:45:07.796118Z","submitted_at":"2022-10-09T15:28:48Z","title":"SparseAdapter: An Easy Approach for Improving the Parameter-Efficiency of Adapters","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.04284","snapshot_observed_at":"2026-08-07T15:05:16.486061Z","title":"Sparseadapter: An easy approach for improving the parameter-efficiency of adapters","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.486061Z"},"links":{"cited_paper":"/paper/2210.04284","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:9c7f237df4b4bdbc6d361cb796e6a5bd3f549841dcf65b536d3d1489cedce215","observation_id":"b369802f-7514-4d8c-bc95-d06f81b00da0","resolution":{"observed_at":"2026-08-07T15:05:16.486061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T15:05:16.542905Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.542905Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:05639d74a3decb03418e84b4be67b2486f99e15b270e6a62069a51ebdb5ee12e","observation_id":"44a2a934-5672-4d7b-8b2e-0756933028df","resolution":{"observed_at":"2026-08-07T15:05:16.542905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.827776Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":"8c924abe-1814-4469-a7e8-f98fcba20919","year":2019},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.629862Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:2b7e171f6ea099b9f1409ca7ea439e964b56070908c1d3ab9432d395086678b9","observation_id":"66c33497-9e18-4736-96d2-6e9e11923946","resolution":{"observed_at":"2026-08-07T15:05:21.937018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:16.707178Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.707178Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:b155d420f2dfd28eb47bcb24eea6c61074597a015c3513843a64e5638da87c74","observation_id":"c09dca73-b644-4614-87f3-03714e94a006","resolution":{"observed_at":"2026-08-07T15:05:16.707178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T15:05:16.872009Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.872009Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:504e8ff8688ff0b02def78cdd45d0502eb678c81ee402b189cb988fc978e800d","observation_id":"b618ca45-392e-4a07-9b72-412fa770fcb1","resolution":{"observed_at":"2026-08-07T15:05:16.872009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-07T15:05:16.951400Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.951400Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:d8555d5e93d0adbb009168b1f33f242f23c89c203d4d087321c7c25dc82d9927","observation_id":"b4b4d9fd-3564-4e50-8f30-2b84d5db40ff","resolution":{"observed_at":"2026-08-07T15:05:16.951400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07374","last_updated":"2025-02-18T05:20:33Z","snapshot_observed_at":"2026-08-08T12:55:09.579243Z","submitted_at":"2025-02-11T08:48:48Z","title":"LLMs Can Easily Learn to Reason from Demonstrations Structure, not content, is what matters!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07374","snapshot_observed_at":"2026-08-07T15:05:17.071531Z","title":"Patil, Matei Zaharia, Joseph E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.071531Z"},"links":{"cited_paper":"/paper/2502.07374","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:5ce8f86fcd41f49988681b0b7ad4daf6691d949896dbe096647c2ae89d670c16","observation_id":"34f5e305-0b0e-4771-9a15-bea1284fcc89","resolution":{"observed_at":"2026-08-07T15:05:17.071531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.172094Z","title":"Numinamath","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.172094Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:d4fbbb73deb24a0d24c037184fabcb92c199b35c6682f855d6a51baa41213e70","observation_id":"68eeb38e-a341-4639-bb0b-0b8ce748747e","resolution":{"observed_at":"2026-08-07T15:05:17.172094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-07-06T10:29:18.734092Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-07T15:05:17.235203Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation, January 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.235203Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:baca8f61894a35e247ecd589aa68c18d7fc9cc3fed0a781105fc31a7587c3853","observation_id":"46ac53ae-08cc-4531-81a5-3f28b362e45f","resolution":{"observed_at":"2026-08-07T15:05:17.235203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:17.316737Z","title":"Alpacaeval: An automatic evaluator of instruction-following models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.316737Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:7d4241d0d7e6db39a9fc267ff556dd8ceb534d0b3eb3e13e1d951d436654be79","observation_id":"9cd70891-dba0-49ca-8880-a9e4d17bf1ab","resolution":{"observed_at":"2026-08-07T15:05:17.316737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02130","last_updated":"2025-03-31T19:41:52Z","snapshot_observed_at":"2026-08-07T17:32:04.628362Z","submitted_at":"2025-03-03T23:35:23Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02130","snapshot_observed_at":"2026-08-07T15:05:17.376218Z","title":"Forgetting Transformer: Softmax Attention with a Forget Gate, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.376218Z"},"links":{"cited_paper":"/paper/2503.02130","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:93f6548b5e9197600647d148cf6f76b6bb0762cb1b23f8e97b5cf7e325ea7e4a","observation_id":"ff4bc00a-3230-4281-ab2e-6656d2c1f2bb","resolution":{"observed_at":"2026-08-07T15:05:17.376218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06668","last_updated":"2024-02-13T22:37:39Z","snapshot_observed_at":"2026-07-06T16:46:06.801011Z","submitted_at":"2023-11-11T21:19:44Z","title":"In-context Vectors: Making In Context Learning More Effective and Controllable Through Latent Space Steering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06668","snapshot_observed_at":"2026-08-07T15:05:17.455869Z","title":"In-context vectors: Making in context learning more effective and controllable through latent space steering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.455869Z"},"links":{"cited_paper":"/paper/2311.06668","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:6c3d16631def2e87e873280a7330be38320e4b7e3db6289dd3261e2397092e3a","observation_id":"230253f7-1030-4595-8aa5-ef821a7fa717","resolution":{"observed_at":"2026-08-07T15:05:17.455869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06243","last_updated":"2024-04-28T20:05:02Z","snapshot_observed_at":"2026-07-06T16:45:51.193825Z","submitted_at":"2023-11-10T18:59:54Z","title":"Parameter-Efficient Orthogonal Finetuning via Butterfly Factorization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06243","snapshot_observed_at":"2026-08-07T15:05:17.543801Z","title":"Parameter-efficient orthogonal finetuning via butterfly factorization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.543801Z"},"links":{"cited_paper":"/paper/2311.06243","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:f9d7bf9256189ee7eeeb07f1846e387914e7abf972e29ff5074648f22487860a","observation_id":"ad3441ee-d468-4673-b568-576ea0b8e971","resolution":{"observed_at":"2026-08-07T15:05:17.543801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.15997","last_updated":"2024-07-03T05:21:02Z","snapshot_observed_at":"2026-07-06T17:08:04.891015Z","submitted_at":"2023-12-26T11:01:36Z","title":"Aligning Large Language Models with Human Preferences through Representation Engineering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.15997","snapshot_observed_at":"2026-08-07T15:05:17.598415Z","title":"Aligning large language models with human preferences through representation engineering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.598415Z"},"links":{"cited_paper":"/paper/2312.15997","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:5a472b10247438ef14dc90fa862e971c114cca57872e30df0ef1921be8a03821","observation_id":"733fb8d7-ec21-433b-b1a7-dec171a681e6","resolution":{"observed_at":"2026-08-07T15:05:17.598415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16385","last_updated":"2025-03-20T17:46:38Z","snapshot_observed_at":"2026-08-07T16:48:28.522357Z","submitted_at":"2025-03-20T17:46:38Z","title":"Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16385","snapshot_observed_at":"2026-08-07T15:05:17.677275Z","title":"Deconstructing Long Chain-of-Thought: A Structured Reasoning Optimization Framework for Long CoT Distillation, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.677275Z"},"links":{"cited_paper":"/paper/2503.16385","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:c860d744b16a460c54f4d4d8a73bcc05bd526ce6907f9a113989fe2671c78ac3","observation_id":"6c720b9a-7f7e-4f4a-8683-72bde472d96a","resolution":{"observed_at":"2026-08-07T15:05:17.677275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-07T15:05:17.747787Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.747787Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:b553373a5f8bc7d1ce2fe9ef800f42cb30567a113a9d0abeb76f5bb8aa640c68","observation_id":"bb867424-b9c0-40a4-91f1-230646a0278e","resolution":{"observed_at":"2026-08-07T15:05:17.747787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-07T15:05:17.803938Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.803938Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:1eaba88e61a4fe079c768197fbdfcd8bc9b97aebef1ff3e1ca2f8c28b7084803","observation_id":"125abb68-a687-4ad8-acb7-69af4274630c","resolution":{"observed_at":"2026-08-07T15:05:17.803938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-07T15:05:17.887048Z","title":"Glu variants improve transformer","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.887048Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:bfd9d00d8b789c32d0a9c316877c67d180febd7fd320ee7f40732e6b8ccbcf87","observation_id":"ba14f151-1384-4bf2-8424-f341d9f5056b","resolution":{"observed_at":"2026-08-07T15:05:17.887048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16334","last_updated":"2025-06-30T04:21:26Z","snapshot_observed_at":"2026-08-07T16:48:36.034637Z","submitted_at":"2025-03-20T16:55:26Z","title":"LLM Braces: Straightening Out LLM Predictions with Relevant Sub-Updates","version":2},"cited_work":{"arxiv_id":"2503.16334","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.16334","snapshot_observed_at":"2026-08-07T15:05:20.513645Z","title":"LLM Braces: Straightening Out LLM Predictions with Relevant Sub-Updates","venue":"cs.CL","work_id":"7aabfca9-202f-4d71-b12c-3946fb0c39b1","year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.940629Z"},"links":{"cited_paper":"/paper/2503.16334","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:022d21c19bc8444c4671927492bbf7660eb031feac8c6d30df6d90cfe12bc295","observation_id":"f37b9ff8-a8e2-4dad-b2d9-4f044e4e8287","resolution":{"observed_at":"2026-08-07T15:05:20.572623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05124","last_updated":"2022-05-10T19:04:37Z","snapshot_observed_at":"2026-08-08T01:27:21.861290Z","submitted_at":"2022-05-10T19:04:37Z","title":"Extracting Latent Steering Vectors from Pretrained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.05124","snapshot_observed_at":"2026-08-07T15:05:17.998310Z","title":"Extracting latent steering vectors from pretrained language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:17.998310Z"},"links":{"cited_paper":"/paper/2205.05124","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:4d2f46fd95469445ad7c83091ed15ad2c9df2008abc721f70e3d9b6c049c4d11","observation_id":"91217912-0b99-41be-a8ce-fef01a32ef9d","resolution":{"observed_at":"2026-08-07T15:05:17.998310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01470","last_updated":"2019-07-02T15:56:20Z","snapshot_observed_at":"2026-08-03T14:16:36.317369Z","submitted_at":"2019-07-02T15:56:20Z","title":"Augmenting Self-attention with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01470","snapshot_observed_at":"2026-08-07T15:05:18.057429Z","title":"Augmenting self-attention with persistent memory","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.057429Z"},"links":{"cited_paper":"/paper/1907.01470","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:41047f21d00d2db2d32b697a4483baa52353d9937a5596b7e98b0eba136acbba","observation_id":"503f1712-bfa0-4fae-a5b4-ac58094778da","resolution":{"observed_at":"2026-08-07T15:05:18.057429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.600773Z","title":"End-to-end memory networks.Advances in neural information processing systems , 28, 2015","venue":null,"work_id":"0e736095-4484-449a-89c4-e1776b49adb0","year":2015},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.129636Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:0c9fc1abcf65241100f6752b6cfe6b529d4b66fb088996594138aac8a6c76974","observation_id":"b3b9e273-3a2e-4d4a-9d54-87aee7d81162","resolution":{"observed_at":"2026-08-07T15:05:21.675450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11314","last_updated":"2025-06-11T03:55:09Z","snapshot_observed_at":"2026-08-07T17:04:15.538727Z","submitted_at":"2025-03-14T11:30:37Z","title":"Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11314","snapshot_observed_at":"2026-08-07T15:05:18.186011Z","title":"Unlocking General Long Chain-of-Thought Reasoning Capabilities of Large Language Models via Representation Engineering, March 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.186011Z"},"links":{"cited_paper":"/paper/2503.11314","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:fa72b2bedd4afe4b085259e457e588b59a1815427ae7cda5df4e60d22f9309dc","observation_id":"9d3f7704-a80b-4415-81ab-03d1b3823450","resolution":{"observed_at":"2026-08-07T15:05:18.186011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:18.232468Z","title":"Open Thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.232468Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:60784eba1d011ae10fd31e114c99c9b834093817ed8303e99bd5358fddaca784","observation_id":"320dd58c-efa1-4828-bc2d-5b2f5235d66b","resolution":{"observed_at":"2026-08-07T15:05:18.232468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-07T15:05:18.268620Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.268620Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:5e29dc29f0268ef369dc6687de7b50b4489521691aea0c8d8d8622d830719c89","observation_id":"9e31af5f-ba6e-45b9-98da-6b8ec303106e","resolution":{"observed_at":"2026-08-07T15:05:18.268620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12410","last_updated":"2022-11-02T02:47:17Z","snapshot_observed_at":"2026-08-07T19:57:36.466885Z","submitted_at":"2022-05-24T23:41:22Z","title":"AdaMix: Mixture-of-Adaptations for Parameter-efficient Model Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12410","snapshot_observed_at":"2026-08-07T15:05:18.346073Z","title":"Adamix: Mixture-of-adaptations for parameter-efficient model tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.346073Z"},"links":{"cited_paper":"/paper/2205.12410","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:03f893958003bf5ae851637c1390dda0472673d7dfb325284d00729a67c5d454","observation_id":"a3e006d8-133f-4a32-8f27-dc6c2ae53af5","resolution":{"observed_at":"2026-08-07T15:05:18.346073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13640","last_updated":"2025-03-13T16:16:12Z","snapshot_observed_at":"2026-08-08T01:05:51.654089Z","submitted_at":"2024-10-17T15:09:24Z","title":"Latent Space Chain-of-Embedding Enables Output-free LLM Self-Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13640","snapshot_observed_at":"2026-08-07T15:05:18.423772Z","title":"Wong, and Rui Wang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.423772Z"},"links":{"cited_paper":"/paper/2410.13640","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:1df417f6148f9de1ed9784ed5e357de925d4ab9bc03c5c1197c75cd6a76f876f","observation_id":"0017b253-c6cf-4eef-91a7-27d7029881db","resolution":{"observed_at":"2026-08-07T15:05:18.423772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.357259Z","title":"Wong, Zhuosheng Zhang, and Rui Wang","venue":null,"work_id":"c4608848-c100-4c15-b8b4-8923def7e52d","year":null},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.497508Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:aa873f0379de02a20820a1774e65d9d48df2b80e68d59ef9c08fe9a45c75cd5d","observation_id":"dadb16df-3acd-428a-ae37-a59c1aa4f0ad","resolution":{"observed_at":"2026-08-07T15:05:21.465900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T15:05:18.633434Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.633434Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:5e8b40cdd3d9742c6a2b96a0b8b50acb16d9c37bda9ab9abe057531bdcc59b10","observation_id":"be08691d-74b4-4e02-8710-feccd04bb026","resolution":{"observed_at":"2026-08-07T15:05:18.633434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10460","last_updated":"2025-05-28T12:32:29Z","snapshot_observed_at":"2026-08-08T01:11:14.602172Z","submitted_at":"2025-03-13T15:29:22Z","title":"Light-R1: Curriculum SFT, DPO and RL for Long COT from Scratch and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10460","snapshot_observed_at":"2026-08-07T15:05:18.720509Z","title":"Light-r1: Curriculum sft, dpo and rl for long cot from scratch and beyond","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.720509Z"},"links":{"cited_paper":"/paper/2503.10460","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:da7b2737bf5e658aedb6482c04091e96fa5f2f96f9a28292bb5909c071284e74","observation_id":"8a891a60-d82e-4554-820c-e3eec9d5f64f","resolution":{"observed_at":"2026-08-07T15:05:18.720509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15179","last_updated":"2024-06-02T09:05:31Z","snapshot_observed_at":"2026-07-06T17:34:28.430476Z","submitted_at":"2024-02-23T08:21:02Z","title":"Advancing Parameter Efficiency in Fine-tuning via Representation Editing","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15179","snapshot_observed_at":"2026-08-07T15:05:18.775375Z","title":"Advancing Parameter Efficiency in Fine-tuning via Representation Editing, June 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.775375Z"},"links":{"cited_paper":"/paper/2402.15179","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:3d760a72510e46dd6d9785ef375ee89ba2301303c013e8d143adaa7979af2f77","observation_id":"a2ac8587-3ae2-4ad3-811c-031ed8cceb80","resolution":{"observed_at":"2026-08-07T15:05:18.775375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:21.172775Z","title":"Manning, and Christopher Potts","venue":null,"work_id":"1e852d1a-6ea1-442b-8101-4a084499b202","year":null},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.852749Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:fe77f28bd82b4d9d212a08ec4f33c4cd19675aad4b9c388d040abd10c26eeefa","observation_id":"344a521c-fd11-4e3d-beb1-43cd82ff1f3f","resolution":{"observed_at":"2026-08-07T15:05:21.254712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19574","last_updated":"2024-12-05T12:19:38Z","snapshot_observed_at":"2026-07-06T19:58:48.586415Z","submitted_at":"2024-11-29T09:42:38Z","title":"KV Shifting Attention Enhances Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19574","snapshot_observed_at":"2026-08-07T15:05:19.100540Z","title":"KV Shifting Attention Enhances Language Modeling, December 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.100540Z"},"links":{"cited_paper":"/paper/2411.19574","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:009a49a3381083a1f2ac700752ceb2271cea9b1a4ca62357c160d100b80f767b","observation_id":"4abe153e-e8b6-4594-87b5-07c32f2a92a7","resolution":{"observed_at":"2026-08-07T15:05:19.100540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13116","last_updated":"2024-10-21T16:22:33Z","snapshot_observed_at":"2026-08-02T17:17:56.296462Z","submitted_at":"2024-02-20T16:17:37Z","title":"A Survey on Knowledge Distillation of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13116","snapshot_observed_at":"2026-08-07T15:05:19.185123Z","title":"A survey on knowledge distillation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.185123Z"},"links":{"cited_paper":"/paper/2402.13116","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:9a220a75f9fe9caeb65970cf1da747a2fea19afdf05139f711ac8907459b8847","observation_id":"68cc455c-744e-4eb2-b860-f4fe8f6ba44a","resolution":{"observed_at":"2026-08-07T15:05:19.185123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03592","last_updated":"2024-05-22T17:52:31Z","snapshot_observed_at":"2026-07-06T17:55:44.838732Z","submitted_at":"2024-04-04T17:00:37Z","title":"ReFT: Representation Finetuning for Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03592","snapshot_observed_at":"2026-08-07T15:05:18.938632Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.938632Z"},"links":{"cited_paper":"/paper/2404.03592","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:2176e9bb89e8e16c34b01571c62cbd3ab284da1f7df480ff9c432f7ce386b797","observation_id":"50c6d867-dd34-4e29-b1ff-b321fb8aa9d0","resolution":{"observed_at":"2026-08-07T15:05:18.938632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-07T15:05:19.412270Z","title":"LIMO: Less is More for Reasoning, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.412270Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:b1fab1bcd900f598bd5c02361946dce0bd42a74274cf9cbc581f0e2f67814250","observation_id":"8271824a-779a-48a6-9695-a63abe4ecf7c","resolution":{"observed_at":"2026-08-07T15:05:19.412270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:05:19.565050Z","title":"Root mean square layer normalization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.565050Z"},"links":{"citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:4790fcbf53d5a7e78fcc0c5f8996e900c7f6137d0e5a58eb96dc9b63bf580b88","observation_id":"037e2569-19b9-4245-8b92-657cd2b491a9","resolution":{"observed_at":"2026-08-07T15:05:19.565050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:05:19.290571Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.290571Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:26e4c1baf1d00d89dd4fd5d8a415f8af470697db7972d30dbdb08c69ed622fa7","observation_id":"e7a9876b-4c3f-4e46-a80a-426c9a5170fa","resolution":{"observed_at":"2026-08-07T15:05:19.290571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-07T15:05:19.897437Z","title":"Llamafactory: Unified efficient fine-tuning of 100+ language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.897437Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:f18777bfdc72677a4a6bd7d590102e28a5c71d10ff41f98c46a575542e6e1b9a","observation_id":"4dea9049-7e97-4eee-b831-8dcb2bf744cd","resolution":{"observed_at":"2026-08-07T15:05:19.897437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.10512","last_updated":"2023-12-20T20:56:14Z","snapshot_observed_at":"2026-07-06T15:05:16.471478Z","submitted_at":"2023-03-18T22:36:25Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter-Efficient Fine-Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.10512","snapshot_observed_at":"2026-08-07T15:05:19.743618Z","title":"AdaLoRA: Adaptive Budget Allocation for Parameter- Efficient Fine-Tuning, December 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:19.743618Z"},"links":{"cited_paper":"/paper/2303.10512","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:2afbd9d952408d9710a021c3097bc739b4e9cf89a64b63e47293821252da174c","observation_id":"f93021cc-42b0-443d-91f0-902852f32316","resolution":{"observed_at":"2026-08-07T15:05:19.743618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T15:05:16.794991Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:16.794991Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:81e88695795edb913662157a2def30069f921058dac7568b4702df8719c4eb01","observation_id":"24cc940b-bbd8-451f-a97a-c0a53707b18a","resolution":{"observed_at":"2026-08-07T15:05:16.794991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14039","last_updated":"2024-10-30T12:10:42Z","snapshot_observed_at":"2026-07-06T18:18:12.096996Z","submitted_at":"2024-05-22T22:22:25Z","title":"Embedding Trajectory for Out-of-Distribution Detection in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":"2405.14039","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.14039","snapshot_observed_at":"2026-08-07T15:05:20.243190Z","title":"Embedding Trajectory for Out-of-Distribution Detection in Mathematical Reasoning","venue":"cs.CL","work_id":"8e4f7017-efa3-42e6-894d-ed53cc5710d4","year":2024},"citing_paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T15:05:18.572631Z"},"links":{"cited_paper":"/paper/2405.14039","citing_paper":"/paper/2505.17153"},"observation_digest":"sha256:3aa7863e59e6e55beafaafa60863fa884e5f4d02b9754ef9203442afbf121bf4","observation_id":"26176ccd-d43a-4b24-b6a3-2ac556b85e9f","resolution":{"observed_at":"2026-08-07T15:05:20.328237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.17153","last_updated":"2025-05-22T11:27:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T08:42:49.400073Z","submitted_at":"2025-05-22T11:27:01Z","title":"Amplify Adjacent Token Differences: Enhancing Long Chain-of-Thought Reasoning with Shift-FFN"},"reference_resolution":{"displayed":50,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":50},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 50 of 50 outbound references and 0 inbound Pith citation observations for arXiv:2505.17153."}