{"as_of":"2026-08-09T17:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:68bec93735ae23864b4d0117e22e605131794db9400d4a06637d3be7f21ce856","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:29:44.311377Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T17:04:38.759385Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T19:58:53.662557Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15758","snapshot_observed_at":"2026-08-05T17:04:38.759385Z","title":"Lapo: Internalizing reasoning efficiency via length-adaptive policy optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.17196","last_updated":"2025-08-29T14:42:16Z","snapshot_observed_at":"2026-08-06T13:40:01.864747Z","submitted_at":"2025-08-24T03:17:50Z","title":"BudgetThinker: Empowering Budget-aware LLM Reasoning with Control Tokens","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T17:04:38.759385Z"},"links":{"cited_paper":"/paper/2507.15758","citing_paper":"/paper/2508.17196"},"observation_digest":"sha256:ec07dbefc441c5758844e30521d24d4d0c32bb433ed6a593e98a215a936cf96c","observation_id":"2fe9cc27-c640-41c8-b2d0-218cc82279ba","resolution":{"observed_at":"2026-08-05T17:04:38.759385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.15758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15758","snapshot_observed_at":"2026-07-03T19:58:53.662557Z","title":"Lapo: Internal- izing reasoning efficiency via length-adaptive policy opti- mization.arXiv:2507.15758","venue":null,"work_id":"067dec86-8688-4cbe-adcd-b713b309bbd5","year":2025},"citing_paper":{"arxiv_id":"2604.08905","last_updated":"2026-04-10T03:13:19Z","snapshot_observed_at":"2026-07-06T22:57:55.179136Z","submitted_at":"2026-04-10T03:13:19Z","title":"StaRPO: Stability-Augmented Reinforcement Policy Optimization","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-10T18:11:49.056805Z"},"links":{"cited_paper":"/paper/2507.15758","citing_paper":"/paper/2604.08905"},"observation_digest":"sha256:9c4d503560b8e3487d11180c21c834c4ad0aecfb4313f40dc124bd77d30abbca","observation_id":"79333e2d-250d-4ace-aee3-0a39cbf8206b","resolution":{"observed_at":"2026-05-11T05:21:00.059202Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"cited_work":{"arxiv_id":"2507.15758","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.15758","snapshot_observed_at":"2026-07-03T19:58:53.662557Z","title":"Lapo: Internal- izing reasoning efficiency via length-adaptive policy opti- mization.arXiv:2507.15758","venue":null,"work_id":"067dec86-8688-4cbe-adcd-b713b309bbd5","year":2025},"citing_paper":{"arxiv_id":"2607.01518","last_updated":"2026-07-01T22:31:10Z","snapshot_observed_at":"2026-08-06T19:26:37.371608Z","submitted_at":"2026-07-01T22:31:10Z","title":"Overthink-Triggered Slowdown Attacks on LVLM-Based Robotic Systems","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-03T19:52:11.018335Z"},"links":{"cited_paper":"/paper/2507.15758","citing_paper":"/paper/2607.01518"},"observation_digest":"sha256:cb4bfd67c6356e4cda0632eef785e36930e9b45a9a5b70a4601e716f9d48d072","observation_id":"66042c5c-5030-4a85-830e-16688a93f121","resolution":{"observed_at":"2026-07-03T19:58:53.664207Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.15758/citation-record","integrity":"/paper/2507.15758/integrity","json":"/paper/2507.15758/citation-record.json","paper":"/paper/2507.15758"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-06T15:29:42.182628Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.182628Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:028a2014236a74bf40570201bad19f479314c776585e98db40386e431c0c8a53","observation_id":"63efb1d1-3055-422a-bacc-3f2a525f4774","resolution":{"observed_at":"2026-08-06T15:29:42.182628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13379","last_updated":"2025-06-26T14:06:49Z","snapshot_observed_at":"2026-08-08T22:27:57.440955Z","submitted_at":"2025-05-19T17:24:16Z","title":"Thinkless: LLM Learns When to Think","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13379","snapshot_observed_at":"2026-08-06T15:29:42.379745Z","title":"Thinkless: Llm learns when to think.arXiv preprint arXiv:2505.13379, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.379745Z"},"links":{"cited_paper":"/paper/2505.13379","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:0fea0eef1349af663677568b28df5a2019238ac16b5c64f475fefb4142e235ac","observation_id":"0c2ae177-ebe1-478c-a172-115c2560f6d9","resolution":{"observed_at":"2026-08-06T15:29:42.379745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T15:29:42.446317Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.446317Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:5d74b3704704d9c91d304bdea303c240ce3c91a9464550b3c5bffe352eaa244d","observation_id":"fc79b765-1550-4f56-949e-23c0b32a0c8c","resolution":{"observed_at":"2026-08-06T15:29:42.446317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-07T19:18:10.858896Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-06T15:29:42.490719Z","title":"Token- budget-aware llm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.490719Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:00641ce0e012b344b506193bdbdc365a6f2e256981f08cc1cbbaf0b6839e54fa","observation_id":"615c17f0-de06-40d5-aa00-90439ad8af3b","resolution":{"observed_at":"2026-08-06T15:29:42.490719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14008","last_updated":"2024-06-06T13:19:44Z","snapshot_observed_at":"2026-08-03T03:39:09.398343Z","submitted_at":"2024-02-21T18:49:26Z","title":"OlympiadBench: A Challenging Benchmark for Promoting AGI with Olympiad-Level Bilingual Multimodal Scientific Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14008","snapshot_observed_at":"2026-08-06T15:29:42.574658Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.574658Z"},"links":{"cited_paper":"/paper/2402.14008","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:fda41b289eeb99a27667e2a854c1501dd5f1336878adfd98bd17b91b9ec75c09","observation_id":"3b866691-815f-4263-bdb7-5c74eda232b8","resolution":{"observed_at":"2026-08-06T15:29:42.574658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T15:29:42.642768Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.642768Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:0149ff86c8b66eba016f7c4a4a5e30b38290f2fe186cadf5a1b5da9a74e32560","observation_id":"ffc127bb-2f9d-4e59-97fc-161b990fc451","resolution":{"observed_at":"2026-08-06T15:29:42.642768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.48550/arxiv.2505.11225","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:44.586237Z","title":"Hapo: Training language models to reason concisely via history-aware policy optimization","venue":null,"work_id":"81ad9735-2caf-464a-919e-e2e16ae442f0","year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.818923Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:4e97aab0501669eea0d1e358e6109e6bb733e06f9095391130f76c982450706f","observation_id":"3c80df40-f92a-4d48-9390-0400681285f8","resolution":{"observed_at":"2026-08-06T15:29:44.660422Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:42.907541Z","title":"Overthink: Slowdown attacks on reasoning llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.907541Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:ec645f9c454755c37ee0942652ca3b8767b9bc497a9d1e067721b4eb04d02e04","observation_id":"5628c428-fb7c-4db6-843d-608cd7a3b9a0","resolution":{"observed_at":"2026-08-06T15:29:42.907541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11896","last_updated":"2025-05-25T13:39:29Z","snapshot_observed_at":"2026-08-07T15:44:24.427443Z","submitted_at":"2025-05-17T08:27:00Z","title":"AdaCoT: Pareto-Optimal Adaptive Chain-of-Thought Triggering via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.11896","snapshot_observed_at":"2026-08-06T15:29:42.965888Z","title":"Adacot: Pareto-optimal adaptive chain-of-thought triggering via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.965888Z"},"links":{"cited_paper":"/paper/2505.11896","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:7f9abd859137969b4c7f3a92c41a4109ecbe44d3f0cae81b7399def02bd50be1","observation_id":"40826666-312f-482b-9b61-0a3ca07a52ce","resolution":{"observed_at":"2026-08-06T15:29:42.965888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-08T03:22:47.699927Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-06T15:29:43.034909Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.034909Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:679b9f03fd3de589d9c3d30722b924cb541c585df967b1eaa401812b8d28f606","observation_id":"4e7f71cc-cee9-4d46-84ad-e4eb1a61b23c","resolution":{"observed_at":"2026-08-06T15:29:43.034909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-06T15:29:43.103227Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.103227Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:a70e986b291607bce7d1773641c20169bd6ff9acf9a902fe4c262445d7d9aca9","observation_id":"031ce5b9-3f8a-48e5-a7ff-64797412ca69","resolution":{"observed_at":"2026-08-06T15:29:43.103227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-06T15:29:43.152143Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.152143Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:4644ed6302e8fec0bf22a170729e4087a45777d8e2cd9e23f17687a44e7fb556","observation_id":"fe021649-68fc-4f31-969b-6cb2d99e2b6e","resolution":{"observed_at":"2026-08-06T15:29:43.152143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18665","last_updated":"2025-02-23T08:50:33Z","snapshot_observed_at":"2026-07-30T15:06:18.011623Z","submitted_at":"2024-06-26T18:10:22Z","title":"RouteLLM: Learning to Route LLMs with Preference Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18665","snapshot_observed_at":"2026-08-06T15:29:43.237643Z","title":"Routellm: Learning to route llms with preference data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.237643Z"},"links":{"cited_paper":"/paper/2406.18665","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:2a190cff31c0978fbe50147fc9b6c70a75485c8f9f4c0c4173f8601351ad62ac","observation_id":"1ca9559b-1e6c-4fd5-938d-e6263e64c308","resolution":{"observed_at":"2026-08-06T15:29:43.237643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:43.338210Z","title":"Concise: Confidence-guided compression in step-by-step efficient reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.338210Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:50379a62de14188d89218a1b900ef8a6afbfc9b8eca8a61a7521fb93f3f363c9","observation_id":"bd09387e-8315-438e-b042-0a555fa54d84","resolution":{"observed_at":"2026-08-06T15:29:43.338210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-06T15:29:43.402800Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.402800Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:dd2b8a03bc38db0fa62ad0f016661c761645ef78adbde8b1b9183ccdfeda5c1f","observation_id":"64582e5a-def5-485d-9a17-831dec3742b0","resolution":{"observed_at":"2026-08-06T15:29:43.402800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-07T04:27:23.738927Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-06T15:29:43.470138Z","title":"Stop overthinking: A survey on efficient reasoning for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.470138Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:5c5a7cd37b7cb4297d71335208ffbb50981e8c0b84a51b0476909c5c9330a411","observation_id":"16de9413-fb86-45b2-9678-08447fd5fd0d","resolution":{"observed_at":"2026-08-06T15:29:43.470138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:43.549175Z","title":"Learning when to think: Shaping adaptive reasoning in r1-style models via multi-stage rl","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.549175Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:ba8bc1b45acd78480a5358991776679d1b021de93b9f84b9af9e891afedbbd3d","observation_id":"970106e8-2575-4f0f-b7b5-89e0db836bf9","resolution":{"observed_at":"2026-08-06T15:29:43.549175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-06T15:29:43.658272Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.658272Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:3bebddff10ca9a62650aca5b3a6864f50ec6bb62e45961f7f2a1851cb809ef78","observation_id":"d5d660cd-42a0-4987-9d75-5cd43b6ef237","resolution":{"observed_at":"2026-08-06T15:29:43.658272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16838","last_updated":"2024-11-20T17:57:26Z","snapshot_observed_at":"2026-07-06T18:36:12.298104Z","submitted_at":"2024-06-24T17:45:59Z","title":"From Decoding to Meta-Generation: Inference-time Algorithms for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16838","snapshot_observed_at":"2026-08-06T15:29:43.802572Z","title":"From decoding to meta-generation: Inference-time algorithms for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.802572Z"},"links":{"cited_paper":"/paper/2406.16838","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:5e2251f793d20164445bf1a6ae2893ca0d0293c38803373c34da60227e8ec566","observation_id":"88529ffc-21a4-4fa3-a5bc-debeba036124","resolution":{"observed_at":"2026-08-06T15:29:43.802572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00724","last_updated":"2025-03-03T07:53:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-01T17:16:04Z","title":"Inference Scaling Laws: An Empirical Analysis of Compute-Optimal Inference for Problem-Solving with Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00724","snapshot_observed_at":"2026-08-06T15:29:43.891579Z","title":"Inference scaling laws: An empirical analysis of compute-optimal inference for problem-solving with language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.891579Z"},"links":{"cited_paper":"/paper/2408.00724","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:025d672e2664c814dacbe28423db01dcfac37032a34616a0818e2dc18edb6f9a","observation_id":"2f248839-594e-4aa9-a5cc-a8be95e04fe2","resolution":{"observed_at":"2026-08-06T15:29:43.891579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:29:43.955617Z","title":"Tokenskip: Controllable chain-of-thought compression in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.955617Z"},"links":{"citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:4345ac78ec8197bd8931fd0f1ae7ed2ac2efc1d8ad6e140c41753291fe8d571f","observation_id":"63e39cad-253f-40a9-9eae-35936d284e34","resolution":{"observed_at":"2026-08-06T15:29:43.955617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18600","last_updated":"2025-03-03T17:08:21Z","snapshot_observed_at":"2026-08-07T17:49:06.764625Z","submitted_at":"2025-02-25T19:36:06Z","title":"Chain of Draft: Thinking Faster by Writing Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18600","snapshot_observed_at":"2026-08-06T15:29:44.051838Z","title":"Chain of draft: Thinking faster by writing less","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:44.051838Z"},"links":{"cited_paper":"/paper/2502.18600","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:ffc4b30c39f0c7650b38f46f504b8f1d9289192ced6a6fff3f695a3503a11606","observation_id":"fdba8db0-4a46-44b5-93ec-e6e4ed21c265","resolution":{"observed_at":"2026-08-06T15:29:44.051838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13417","last_updated":"2025-05-19T17:50:52Z","snapshot_observed_at":"2026-08-07T15:42:59.701048Z","submitted_at":"2025-05-19T17:50:52Z","title":"AdaptThink: Reasoning Models Can Learn When to Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.13417","snapshot_observed_at":"2026-08-06T15:29:44.311377Z","title":"Adaptthink: Reasoning models can learn when to think","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:44.311377Z"},"links":{"cited_paper":"/paper/2505.13417","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:cebd827fab605f0eb73e09dbe92ce4c61165d0f20914f4a63a1faf19df76ed50","observation_id":"1a6ea9b0-bdc5-43fc-a0ff-04b2443f1d8b","resolution":{"observed_at":"2026-08-06T15:29:44.311377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-07-30T08:40:23.849282Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-06T15:29:42.735481Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.735481Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:85366560a7532b67369b1f37458b0742e0574775280bdfe3873a301640e44521","observation_id":"429ce97d-9577-489b-b6e0-91645c229703","resolution":{"observed_at":"2026-08-06T15:29:42.735481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18585","last_updated":"2025-02-18T16:51:53Z","snapshot_observed_at":"2026-08-08T15:09:27.177867Z","submitted_at":"2025-01-30T18:58:18Z","title":"Thoughts Are All Over the Place: On the Underthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18585","snapshot_observed_at":"2026-08-06T15:29:43.738162Z","title":"Thoughts are all over the place: On the underthinking of o1-like llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:43.738162Z"},"links":{"cited_paper":"/paper/2501.18585","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:e963ebc699ae9e4c9e57955e1af016bb724ab450a7e9b52f5c1bfcfb78a4bf0b","observation_id":"e228e5ed-4276-4971-b943-3801b8bf9c36","resolution":{"observed_at":"2026-08-06T15:29:43.738162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-06T15:29:44.153200Z","title":"Demystifying long chain- of-thought reasoning in llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:44.153200Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:1beb2f7548911b634c6a89d424f80156f37c8cabc8af5b22ed7b8dc0b81e0baa","observation_id":"4002c37a-0be0-465f-ae43-b3bb56358af2","resolution":{"observed_at":"2026-08-06T15:29:44.153200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13284","last_updated":"2025-06-19T22:52:45Z","snapshot_observed_at":"2026-08-07T19:53:57.315695Z","submitted_at":"2024-10-17T07:28:18Z","title":"Learning to Route LLMs with Confidence Tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13284","snapshot_observed_at":"2026-08-06T15:29:42.324127Z","title":"Learning to route llms with confidence tokens","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.324127Z"},"links":{"cited_paper":"/paper/2410.13284","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:3866ffcf9e7266edb335eb01441fb5f2979dbd4118dff5e808dc0575a99d6fe6","observation_id":"68ca42b8-4c01-42fa-b60b-a0580f4d084d","resolution":{"observed_at":"2026-08-06T15:29:42.324127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-06T15:29:42.254233Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T15:29:42.254233Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2507.15758"},"observation_digest":"sha256:8adb66d10051ee72ff9fc1381ef43ac763ec21de298171589600d18afad726c1","observation_id":"7167743f-36ee-4791-80e2-9212c2d9a929","resolution":{"observed_at":"2026-08-06T15:29:42.254233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15758","last_updated":"2025-08-14T08:13:36Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-09T00:50:41.198666Z","submitted_at":"2025-07-21T16:14:41Z","title":"LAPO: Internalizing Reasoning Efficiency via Length-Adaptive Policy Optimization"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 3 inbound Pith citation observations for arXiv:2507.15758."}