{"as_of":"2026-08-07T19:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:62f51610a89e3ad29b13e3b1385a2124599e59e071e62c7ce9652b36d6cfee08","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:31:28.767651Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15844/citation-record","integrity":"/paper/2507.15844/integrity","json":"/paper/2507.15844/citation-record.json","paper":"/paper/2507.15844"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T15:31:26.600626Z","title":"L1: controlling how long A reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.600626Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:ebaccd9639830ad1af63231e4a4e96f29b757da921f61c94735dc22ac0edfba1","observation_id":"282d0983-76a0-4e7d-9269-597ef0fabc77","resolution":{"observed_at":"2026-08-06T15:31:26.600626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:26.692180Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.692180Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:5606693d4e6f0bf8390a1af3d29fa0dcdd01acb2050c8f6cbace466b8dee6350","observation_id":"bc1f98b9-2226-48e4-a27a-b217e678a2d8","resolution":{"observed_at":"2026-08-06T15:31:26.692180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09567","last_updated":"2025-07-18T15:57:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-12T17:35:03Z","title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09567","snapshot_observed_at":"2026-08-06T15:31:26.868293Z","title":"URLhttps://doi.org/10.48550/arXiv.2503.09567","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.868293Z"},"links":{"cited_paper":"/paper/2503.09567","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:7f863ccaf2f1471f19f79bdd83bcae122a8b752c72d7bcef544fad5bc4b5abe1","observation_id":"2a4f7ba3-08d8-4a34-9586-a2519ef98720","resolution":{"observed_at":"2026-08-06T15:31:26.868293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:31:27.319209Z","title":"URL https://doi.org/ 10.48550/arXiv.2501.12948","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.319209Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:3f6b3ddfae70b4a29e1b0a2a26a261193dc5b21838615f3ab77a3c64a4f207a3","observation_id":"4fc7dd44-8184-4f22-b1a9-b918be534d1f","resolution":{"observed_at":"2026-08-06T15:31:27.319209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-07T15:43:01.592156Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-06T15:31:27.442287Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.442287Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:097124dbda5abf9c2e62dc2ab0d2c5617bb4b23c7a441578e2339780c24b7c62","observation_id":"6c0aaae6-8018-48ee-8579-0d863a965da8","resolution":{"observed_at":"2026-08-06T15:31:27.442287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-06T15:31:27.609818Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.609818Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:d0c83be2d08d96dfac38a02111f274207d39de3d3d4236a10437a0ad1f9cda50","observation_id":"87229f48-e3d9-4439-b38f-18c0427e85b8","resolution":{"observed_at":"2026-08-06T15:31:27.609818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-06T15:31:27.748148Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.748148Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:cbb39f4937c4301db4022e0dedfab126039a5a1233197d17def8e6fee655e42f","observation_id":"d8c3f112-3400-466c-8a33-b1f78825ba81","resolution":{"observed_at":"2026-08-06T15:31:27.748148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:27.958656Z","title":"URLhttps://doi.org/10.48550/arXiv.2505.11225","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.958656Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:74c06165824abb2fefaa3b47a1844c5032e0ac1638bda52c29cd6b60b1fc6e12","observation_id":"c534d5d1-4d77-4b2e-b298-c0cf235de80c","resolution":{"observed_at":"2026-08-06T15:31:27.958656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14631","last_updated":"2025-05-21T05:17:34Z","snapshot_observed_at":"2026-08-07T15:28:58.246731Z","submitted_at":"2025-05-20T17:23:25Z","title":"Think Only When You Need with Large Hybrid-Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14631","snapshot_observed_at":"2026-08-06T15:31:28.102020Z","title":"URL https:// doi.org/10.48550/arXiv.2505.14631","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.102020Z"},"links":{"cited_paper":"/paper/2505.14631","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:5b3ef38448432b5dbc89422877f532eb68fbeecb8eaffb59a6a005c3fb1eaca0","observation_id":"e0714b9d-f4a4-46c2-9aee-ba6de4f8bcca","resolution":{"observed_at":"2026-08-06T15:31:28.102020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11274","last_updated":"2026-04-17T08:29:27Z","snapshot_observed_at":"2026-07-06T21:25:03.247284Z","submitted_at":"2025-05-16T14:08:04Z","title":"SelfBudgeter: Adaptive Token Allocation for Efficient LLM Reasoning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11274","snapshot_observed_at":"2026-08-06T15:31:28.228889Z","title":"2505.11274","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.228889Z"},"links":{"cited_paper":"/paper/2505.11274","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:f6933cc5fa55af57dc568709e0292d86010d8b887e57164723e0cd06aa9a7047","observation_id":"02bf1114-67cd-4d06-8c9d-f67a7d202e2f","resolution":{"observed_at":"2026-08-06T15:31:28.228889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14183","last_updated":"2025-05-20T10:40:41Z","snapshot_observed_at":"2026-08-07T15:36:34.268994Z","submitted_at":"2025-05-20T10:40:41Z","title":"ThinkSwitcher: When to Think Hard, When to Think Fast","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14183","snapshot_observed_at":"2026-08-06T15:31:28.312222Z","title":"URL https://doi.org/10.48550/arXiv.2505.14183","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.312222Z"},"links":{"cited_paper":"/paper/2505.14183","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:bc8d33b8ab72c1a87027082cc8f4222ba5d06e1544a62f1a8ed6b0e7a595ba40","observation_id":"3754db1e-dab9-47d9-9389-9b7d56f7f4d3","resolution":{"observed_at":"2026-08-06T15:31:28.312222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-06T15:31:28.441783Z","title":"URL https://doi.org/10.48550/arXiv.2505.11896","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.441783Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:d1c5da5e219dedc036ebe9dd5ca0146e6cffdea58ceafff33f4f798c93f84f34","observation_id":"06e9ff18-fa4c-457d-ab68-213df15f9805","resolution":{"observed_at":"2026-08-06T15:31:28.441783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-07T16:06:02.705385Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-06T15:31:28.526529Z","title":"Wenjie Ma, Jingxuan He, Charlie Snell, Tyler Griggs, Sewon Min, and Matei Zaharia","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.526529Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:9108092cea0ae23da099c8bbf87672a4d21924d281152378e7d383c6e13af464","observation_id":"8c52a92a-bdbe-41f5-8298-c7fb10f3f786","resolution":{"observed_at":"2026-08-06T15:31:28.526529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.09858","last_updated":"2025-04-14T04:08:16Z","snapshot_observed_at":"2026-08-07T16:06:02.705385Z","submitted_at":"2025-04-14T04:08:16Z","title":"Reasoning Models Can Be Effective Without Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.09858","snapshot_observed_at":"2026-08-06T15:31:28.578878Z","title":"2504.09858","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.578878Z"},"links":{"cited_paper":"/paper/2504.09858","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:b401be73c28b0c73f6537ac74da913d5efa7ecc738d2e9b3a34bbef561004f4f","observation_id":"040d2d23-8868-452a-8f41-466916fccb9b","resolution":{"observed_at":"2026-08-06T15:31:28.578878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-06T15:31:28.703711Z","title":"URL https: //doi.org/10.48550/arXiv.2412.09413","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.703711Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:9487d65c15e06297a2192aa42c2880113657a0be8665260434e3eeeb37f5e8a6","observation_id":"35312d21-cb31-4f3e-8bda-dc2b7aae9586","resolution":{"observed_at":"2026-08-06T15:31:28.703711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:31:28.722892Z","title":"URL https: //doi.org/10.48550/arXiv.2501.19393","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.722892Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:4a7163927aeb3bd062851c9d3797d014def0ffbde71131b8c33591b94fac359c","observation_id":"5968c0c8-97cd-47c5-a1f7-f0cf736660e6","resolution":{"observed_at":"2026-08-06T15:31:28.722892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.728133Z","title":"Accessed: 2025-07-22","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.728133Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:c59cc905624dda0714aa9993586ef692f41221a7cfbbd84e987140359ed1966d","observation_id":"08e6a92c-a9df-4c47-970e-d32541be5277","resolution":{"observed_at":"2026-08-06T15:31:28.728133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.04881","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:29.177053Z","title":"URL https://doi.org/ 10.48550/arXiv.2505.04881","venue":null,"work_id":"ee5da4b4-0978-42f8-8ef3-b341356e0ff0","year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.733587Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:fc99c702cab00f6f0008182b0368e3a5a65e5c6e0dff66ecfbdcf0f57b3fb2a9","observation_id":"b823124c-5b7f-4289-abb1-10c120f67e88","resolution":{"observed_at":"2026-08-06T15:31:29.181641Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.738590Z","title":"Learning when to think: Shaping adaptive reasoning in r1-style models via multi-stage RL","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.738590Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:c8187dc8db065744cb188e84bc4f856ca014d02758fcb8feadf0ee2aa5c7480b","observation_id":"a077caf7-ac67-47b6-8c0f-5df45d927f99","resolution":{"observed_at":"2026-08-06T15:31:28.738590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.10832","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:29.104930Z","title":"URL https://doi.org/ 10.48550/arXiv.2505.10832","venue":null,"work_id":"5c19466c-a4f1-45cd-93b0-b52ab66426e7","year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.743999Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:63f5858c823b8e616c4fb38296ddf57028b2712ebb89d4a4b168993156ba9748","observation_id":"5c5a568d-8990-4f95-a77f-857af800e004","resolution":{"observed_at":"2026-08-06T15:31:29.109749Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19250","last_updated":"2025-05-25T17:58:50Z","snapshot_observed_at":"2026-08-07T14:15:52.155471Z","submitted_at":"2025-05-25T17:58:50Z","title":"PATS: Process-Level Adaptive Thinking Mode Switching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19250","snapshot_observed_at":"2026-08-06T15:31:28.748477Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.748477Z"},"links":{"cited_paper":"/paper/2505.19250","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:a8f9d1666c1287197d7abf74d002b16d7759a8f5d0777a78191706586c96ee74","observation_id":"3a5e8ee1-c570-490f-991a-e77582d4a762","resolution":{"observed_at":"2026-08-06T15:31:28.748477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.20258","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.999622Z","title":"URL https://doi.org/10.48550/arXiv.2505.20258","venue":null,"work_id":"2955954d-5267-4012-bd0a-37b796c40b0b","year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.753494Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:34ab78bc1fc04c37485450d93d10c2999357c5cbf7566844b309e41060db561a","observation_id":"44edbed9-a921-4666-a661-fa77e446d855","resolution":{"observed_at":"2026-08-06T15:31:29.005466Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05315","last_updated":"2025-05-21T05:40:27Z","snapshot_observed_at":"2026-08-07T15:48:46.300308Z","submitted_at":"2025-05-08T15:01:06Z","title":"Scalable Chain of Thoughts via Elastic Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05315","snapshot_observed_at":"2026-08-06T15:31:28.757943Z","title":"URL https://doi.org/10.48550/arXiv.2505.05315","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.757943Z"},"links":{"cited_paper":"/paper/2505.05315","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:78563f028ba6ad90ec953b398f9f44f1cf97084e2af23b733098bbfebb37acd9","observation_id":"d4571c65-7566-4e78-958d-fde3db65fa6b","resolution":{"observed_at":"2026-08-06T15:31:28.757943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:31:28.763066Z","title":"URLhttps://doi.org/10.48550/arXiv.2504.15895","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.763066Z"},"links":{"citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:b776df4f3b70d4bd9db98b59856fa5bef56542c5822972cb8e621dee218e77d5","observation_id":"092df8c9-b248-4eca-91ce-1631970e42fb","resolution":{"observed_at":"2026-08-06T15:31:28.763066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-06T15:31:28.767651Z","title":"URLhttps://doi.org/10.48550/arXiv.2503.14476","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.767651Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:ca4c48b3ba9eb423face66bf4b97a8aa20371d449e13224cfd81bb55cba74838","observation_id":"a884b321-ad3e-4dd1-8214-a6eead52d5c3","resolution":{"observed_at":"2026-08-06T15:31:28.767651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:31:27.109371Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:27.109371Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:cb790323abcc66e85c9167c1f977737e237e7bb22cd1aa400302d329b465dac4","observation_id":"68b378fb-239c-496d-a120-d98241007ce4","resolution":{"observed_at":"2026-08-06T15:31:27.109371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-06T15:31:28.425196Z","title":"Adacot: Pareto-optimal adaptive chain-of-thought triggering via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:28.425196Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:43bd42224aafaed096798070a4cc304421274bffcbe813326eb534af5cea3190","observation_id":"4b63b925-88cd-4732-a3ce-000e546a4658","resolution":{"observed_at":"2026-08-06T15:31:28.425196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T15:31:26.956879Z","title":"URL https://doi.org/10.48550/arXiv.2412","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.956879Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:e90966cbc0a28260bb69e15cc08ce53bdb5d4412158ee2995ec0c0b50acff47d","observation_id":"c7fbf56c-13cb-4258-ac3f-e4ae51ea39cc","resolution":{"observed_at":"2026-08-06T15:31:26.956879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T15:31:26.625005Z","title":"URL https://doi.org/10.48550/arXiv.2503.04697","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:31:26.625005Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.15844"},"observation_digest":"sha256:9eb365c5937496c03f0a14e36906861b8c28482279651e55a80ce51e2c36a463","observation_id":"4af2d2de-57bc-4c3d-b51b-d6bed7cff138","resolution":{"observed_at":"2026-08-06T15:31:26.625005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15844","last_updated":"2025-08-07T14:12:39Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T09:55:35.190449Z","submitted_at":"2025-07-21T17:52:34Z","title":"Hierarchical Budget Policy Optimization for Adaptive Reasoning"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2507.15844."}