{"as_of":"2026-08-09T11:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3bc22f1eb4d691f039175312609d3917d107a0c507e2c30e3a26781d8b100c35","coverage":[{"denominator":6,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T11:57:56.105261Z","state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2601.04805/citation-record","integrity":"/paper/2601.04805/integrity","json":"/paper/2601.04805/citation-record.json","paper":"/paper/2601.04805"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-03T11:57:55.717976Z","title":"Chenwei Lou, Zewei Sun, Xinnian Liang, Meng Qu, Wei Shen, Wenqi Wang, Yuntao Li, Qingping Yang, and Shuangzhi Wu","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T11:57:55.717976Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2601.04805"},"observation_digest":"sha256:865fbf62330bf63606a9a6f6f5cb18aa8d89044f17d30ccaa3437419ee3879f0","observation_id":"c3668722-a034-4959-8801-38af745e7961","resolution":{"observed_at":"2026-08-03T11:57:55.717976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06627","last_updated":"2024-06-06T21:39:09Z","snapshot_observed_at":"2026-08-02T15:15:54.521833Z","submitted_at":"2024-02-09T18:59:29Z","title":"Feedback Loops With Language Models Drive In-Context Reward Hacking","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06627","snapshot_observed_at":"2026-08-03T11:57:55.899447Z","title":"Alexander Pan, Erik Jones, Meena Jagadeesan, and Ja- cob Steinhardt","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T11:57:55.899447Z"},"links":{"cited_paper":"/paper/2402.06627","citing_paper":"/paper/2601.04805"},"observation_digest":"sha256:73b29a9cda2504c86f1cc1560b032761f41cb7dd01ac90daa74e4ef3f2d98d7e","observation_id":"ca149062-f3c4-4f18-b192-c05c9a81c0c0","resolution":{"observed_at":"2026-08-03T11:57:55.899447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-03T11:57:56.105261Z","title":"arXiv preprint arXiv:2501.09686","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T11:57:56.105261Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2601.04805"},"observation_digest":"sha256:40812bc8e6c8c51ce303d9adb868eae3face3c4557fc24aa10a0a509065fb3ad","observation_id":"f52f6b69-0b3a-4462-a845-512b93b01a08","resolution":{"observed_at":"2026-08-03T11:57:56.105261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-03T11:57:55.505392Z","title":"Zichen Liu, Changyu Chen, Wenjun Li, Penghui Qi, Tianyu Pang, Chao Du, Wee Sun Lee, and Min Lin","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T11:57:55.505392Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2601.04805"},"observation_digest":"sha256:0d209befa18f21a36f92d0f4377acf2da0a4bb2777f0a93216aa6d4930191f68","observation_id":"92821b1a-0390-4fcf-8b03-debe79311163","resolution":{"observed_at":"2026-08-03T11:57:55.505392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-03T11:57:55.221525Z","title":"Karl Cobbe, Vineet Kosaraju, Mohammad Bavarian, Mark Chen, Heewoo Jun, Lukasz Kaiser, Matthias Plappert, Jerry Tworek, Jacob Hilton, Reiichiro Nakano, and 1 others","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T11:57:55.221525Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2601.04805"},"observation_digest":"sha256:e29b019fba413c7bb87ebf008350faef4712961bf64bb8325b47deadb18c5e4d","observation_id":"ac5ae07d-7a07-4554-bcb2-15a2561fdcd8","resolution":{"observed_at":"2026-08-03T11:57:55.221525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-03T11:57:55.346251Z","title":"Aaron Jaech, Adam Kalai, Adam Lerer, Adam Richard- son, Ahmed El-Kishky, Aiden Low, Alec Helyar, Aleksander Madry, Alex Beutel, Alex Carney, and 1 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T11:57:55.346251Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2601.04805"},"observation_digest":"sha256:b49358d51eee129f794dbe1d57d9cb14dce595190e9261b12a04f9ad58fa8d72","observation_id":"395467f8-3c9a-47b1-adba-a8327d70034c","resolution":{"observed_at":"2026-08-03T11:57:55.346251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.04805","last_updated":"2026-06-07T07:40:55Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T03:08:56.368876Z","submitted_at":"2026-01-08T10:38:41Z","title":"Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning"},"reference_resolution":{"displayed":6,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":6},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 6 of 6 outbound references and 0 inbound Pith citation observations for arXiv:2601.04805."}