{"as_of":"2026-08-14T03:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e7925eb311fb1e65d536f9ed6c887d339636c33137cdf1ed014505f49ae9a4b","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:37:03.196744Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:45:10.270039Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T09:19:43.854814Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-08-06T21:45:10.270039Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23840","last_updated":"2025-06-30T13:30:33Z","snapshot_observed_at":"2026-08-10T15:11:41.836176Z","submitted_at":"2025-06-30T13:30:33Z","title":"Do Thinking Tokens Help or Trap? Towards More Efficient Large Reasoning Model","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T21:45:10.270039Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2506.23840"},"observation_digest":"sha256:0451163cd7c6c82460af5fddcd086db62f9a56612890b6c35aa47280c227f979","observation_id":"d52c04d0-32e9-4730-b36a-609bd4a0a2d3","resolution":{"observed_at":"2026-08-06T21:45:10.270039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-08-06T17:54:17.672973Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09662","last_updated":"2025-07-13T14:51:59Z","snapshot_observed_at":"2026-08-14T02:30:04.338310Z","submitted_at":"2025-07-13T14:51:59Z","title":"Towards Concise and Adaptive Thinking in Large Reasoning Models: A Survey","version":1},"reference_index":168,"source":"arxiv_source","source_observed_at":"2026-08-06T17:54:17.672973Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2507.09662"},"observation_digest":"sha256:e511c611e28f8027688443814611005f5f12611a0554380a744c6798871a5f05","observation_id":"02d91076-4512-4bc6-ad22-2425111373bc","resolution":{"observed_at":"2026-08-06T17:54:17.672973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-08-04T07:59:53.678805Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards.arXiv preprint arXiv:2505.18298,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.23486","last_updated":"2026-07-03T18:03:08Z","snapshot_observed_at":"2026-08-09T00:53:49.879051Z","submitted_at":"2025-10-27T16:17:45Z","title":"Learning to Reason Efficiently with Discounted Reinforcement Learning","version":3},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-04T07:59:53.678805Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2510.23486"},"observation_digest":"sha256:7b3ad942091be6122bab1ffe6f65efe9b8d00bb7fa1fb6e7fc6e99103c6103db","observation_id":"e800aca3-effb-423a-8206-db125821c2c5","resolution":{"observed_at":"2026-08-04T07:59:53.678805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":"2505.18298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-07-04T09:19:43.854814Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards","venue":null,"work_id":"3e34189b-2679-47d3-96ef-27405bed04a7","year":2025},"citing_paper":{"arxiv_id":"2601.05242","last_updated":"2026-01-08T18:59:24Z","snapshot_observed_at":"2026-08-04T04:35:21.359264Z","submitted_at":"2026-01-08T18:59:24Z","title":"GDPO: Group reward-Decoupled Normalization Policy Optimization for Multi-reward RL Optimization","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-15T05:31:55.864438Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2601.05242"},"observation_digest":"sha256:9ff436a619a7752e84f82dcf6cedd717d275b9851f147d73ac1f5a862cd08705","observation_id":"56fffa5f-907e-49f8-a5be-9506a292801d","resolution":{"observed_at":"2026-05-15T05:31:56.036833Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":"2505.18298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-07-04T09:19:43.854814Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards","venue":null,"work_id":"3e34189b-2679-47d3-96ef-27405bed04a7","year":2025},"citing_paper":{"arxiv_id":"2605.07316","last_updated":"2026-05-08T06:25:08Z","snapshot_observed_at":"2026-08-13T18:09:09.815309Z","submitted_at":"2026-05-08T06:25:08Z","title":"Implicit Compression Regularization: Concise Reasoning via Internal Shorter Distributions in RL Post-Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:20.864362Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2605.07316"},"observation_digest":"sha256:348acf3f7dddd40a3ece7eebcc6658911a7ccfba9cad91a92355eed26f9de30c","observation_id":"4369648a-efbc-44ca-b123-55488db6a1dc","resolution":{"observed_at":"2026-05-11T04:35:59.701953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":"2505.18298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-07-04T09:19:43.854814Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards","venue":null,"work_id":"3e34189b-2679-47d3-96ef-27405bed04a7","year":2025},"citing_paper":{"arxiv_id":"2605.22211","last_updated":"2026-05-21T09:16:27Z","snapshot_observed_at":"2026-07-06T23:32:35.159280Z","submitted_at":"2026-05-21T09:16:27Z","title":"CLORE: Content-Level Optimization for Reasoning Efficiency","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-22T05:50:23.111591Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2605.22211"},"observation_digest":"sha256:3c97388b7f1029a90eedfca9e8527b3cf9722386ba92b4baf93beeb6a9cf1043","observation_id":"f1e542d4-bdda-4a54-853a-dcf3a992cc5b","resolution":{"observed_at":"2026-05-22T05:51:08.229808Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":"2505.18298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-07-04T09:19:43.854814Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards","venue":null,"work_id":"3e34189b-2679-47d3-96ef-27405bed04a7","year":2025},"citing_paper":{"arxiv_id":"2606.19927","last_updated":"2026-06-18T08:28:26Z","snapshot_observed_at":"2026-08-10T23:58:59.566249Z","submitted_at":"2026-06-18T08:28:26Z","title":"CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T17:56:34.203135Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2606.19927"},"observation_digest":"sha256:1ca5e17523ba2a133e1ec4dacd87490fb850af96cba0da9d7461d8daec799a2c","observation_id":"bb273491-ab63-42ba-8e1b-99c1e0dfdacf","resolution":{"observed_at":"2026-07-04T03:29:31.439181Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"cited_work":{"arxiv_id":"2505.18298","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.18298","snapshot_observed_at":"2026-07-04T09:19:43.854814Z","title":"Thinking fast and right: Balancing accuracy and reasoning length with adaptive rewards","venue":null,"work_id":"3e34189b-2679-47d3-96ef-27405bed04a7","year":2025},"citing_paper":{"arxiv_id":"2606.22716","last_updated":"2026-06-21T23:27:12Z","snapshot_observed_at":"2026-08-02T15:57:58.597260Z","submitted_at":"2026-06-21T23:27:12Z","title":"Beyond Penalizing Mistakes: Stabilizing Efficiency Training in Large Reasoning Models via Adaptive Correct-Only Rewards","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-26T10:12:30.692295Z"},"links":{"cited_paper":"/paper/2505.18298","citing_paper":"/paper/2606.22716"},"observation_digest":"sha256:9ca0a1124fc1250148d5048175c09bb43f9818b6861d1fa289a3b2d8d39ba98c","observation_id":"3782feab-adce-4d78-806e-cc9f1647c702","resolution":{"observed_at":"2026-07-04T09:19:43.856293Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.18298/citation-record","integrity":"/paper/2505.18298/integrity","json":"/paper/2505.18298/citation-record.json","paper":"/paper/2505.18298"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T14:37:00.874264Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:00.874264Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:6d3be51f6ace9f817a2f09250c20974caa1548ff1e5296f93f8cb2bba40941a7","observation_id":"442ab1f7-9fc6-484f-bc92-061aefa9a772","resolution":{"observed_at":"2026-08-07T14:37:00.874264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:01.003276Z","title":"Training language models to reason efficiently.arXiv preprint arXiv:2502.04463, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.003276Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:96748fa0e264540fb3b35edae06532537a6994264d31d3bc0c6d7753de295cd8","observation_id":"8f53ce4f-0aef-4a8a-8e9f-3731ce5fe379","resolution":{"observed_at":"2026-08-07T14:37:01.003276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-07T14:37:01.107838Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms.arXiv preprint arXiv:2412.21187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.107838Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:58e6aa7f24189b281327d46ea05ac75ee6240084132694437063276670e3c4e4","observation_id":"72a9f013-a6a3-47ba-a1df-020837f1e845","resolution":{"observed_at":"2026-08-07T14:37:01.107838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T14:37:01.174456Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.174456Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:89b57de771d4f0c9eaddcaa0298e4247b6e348721c161300284b977c3ca08e8a","observation_id":"b3663651-1041-422a-858d-3edb87b86a86","resolution":{"observed_at":"2026-08-07T14:37:01.174456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:04.429100Z","title":"competitive programming platform.https://codeforces.com/, 2025","venue":null,"work_id":"345b0171-c1a3-48f5-9f58-c6bff19ed2ae","year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.215547Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:89ddfda6908d85fbc87590eeb48a3a81cd29cf2076c7eda605819fa874a4e937","observation_id":"51308257-6ebd-4863-a821-4f87adf34c01","resolution":{"observed_at":"2026-08-07T14:37:04.503936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:01.267450Z","title":"Efficient reasoning models: A survey.arXiv preprint arXiv:2504.10903, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.267450Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:88f294deb939396ae8739309ba77305db862fae827ab0e83970b76f3f922c7db","observation_id":"c970b6b3-d015-41fc-ba95-5c2ab9399b22","resolution":{"observed_at":"2026-08-07T14:37:01.267450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-13T14:35:44.135264Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-07T14:37:01.324509Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models.arXiv preprint arXiv:2410.07985, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.324509Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:25cb097dbe6dd18dd1efc0aac3a728e38cdefe8de2cd5175d799249a39ac823a","observation_id":"5ee06ac6-e9c8-4669-a56a-d1e83aa8f32b","resolution":{"observed_at":"2026-08-07T14:37:01.324509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:01.397009Z","title":"Scaling laws for reward model overoptimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.397009Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:f725f463849c9a98eac5081abace129662e9d9084a71d0c59f9fb150e4779695","observation_id":"38674f00-a0af-40af-b4f9-bd9e328a6162","resolution":{"observed_at":"2026-08-07T14:37:01.397009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-13T15:58:13.809876Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T14:37:01.478805Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.478805Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:98b4e33d59a7ada694058209ccf5c2f86fc7c6a4297d1a87bce9b715cbb38edb","observation_id":"8832b3e4-85ff-4a45-9030-0a56a9b4c4ce","resolution":{"observed_at":"2026-08-07T14:37:01.478805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18547","last_updated":"2025-06-02T00:44:09Z","snapshot_observed_at":"2026-08-13T10:37:12.511011Z","submitted_at":"2024-12-24T16:55:45Z","title":"Token-Budget-Aware LLM Reasoning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18547","snapshot_observed_at":"2026-08-07T14:37:01.537382Z","title":"Token-budget-aware llm reasoning.arXiv preprint arXiv:2412.18547, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.537382Z"},"links":{"cited_paper":"/paper/2412.18547","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:bc8a11af6c6d3c5fd5696d017d47370605efd9fceec7b55a37c6f173391bb210","observation_id":"b90ca9c3-e075-477f-9356-016a9a549240","resolution":{"observed_at":"2026-08-07T14:37:01.537382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:01.603480Z","title":"Olympiadbench: A challenging benchmark for promoting agi with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.603480Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:a163d2d4302eeddd5d009b047de1ed960b72a4aa23cfa7d13954b454200bb6db","observation_id":"be7cfda0-09a0-4455-874b-d240ddc9084d","resolution":{"observed_at":"2026-08-07T14:37:01.603480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-07T14:37:01.676325Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.676325Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:5875280fc8495c4aa9108b2f849cb49ca2efd47e3fa32e43fcbba2eae2f3a295","observation_id":"dcef9361-7a71-4c42-88a1-def13466c23d","resolution":{"observed_at":"2026-08-07T14:37:01.676325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01296","last_updated":"2025-04-02T01:59:26Z","snapshot_observed_at":"2026-08-13T14:42:27.278298Z","submitted_at":"2025-04-02T01:59:26Z","title":"ThinkPrune: Pruning Long Chain-of-Thought of LLMs via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01296","snapshot_observed_at":"2026-08-07T14:37:01.733717Z","title":"Thinkprune: Pruning long chain-of-thought of llms via reinforcement learning.arXiv preprint arXiv:2504.01296, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.733717Z"},"links":{"cited_paper":"/paper/2504.01296","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:846324c0cb25cc03dbf3c3f0e6158bdf83fca58562c68d1e3f19bdf89fd67e04","observation_id":"664a0074-5786-45a7-a606-0116e12b066e","resolution":{"observed_at":"2026-08-07T14:37:01.733717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:01.791923Z","title":"C3ot: Generating shorter chain-of- thought without compromising effectiveness","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.791923Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:56154949b0d11a34ccf98d05a2349f6f002907ae931f43491ca40e12ac9355d0","observation_id":"5856107e-8d78-40cd-af8d-bca9abfc7d6f","resolution":{"observed_at":"2026-08-07T14:37:01.791923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T14:37:01.878223Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.878223Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:118cea0c532137d6640c99f291dee887054d750dc013045dc2c0c0e885965fb0","observation_id":"7ab5e3d9-f52c-45d2-b9af-3ab106d5cec7","resolution":{"observed_at":"2026-08-07T14:37:01.878223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:01.939588Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.939588Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:491898128197eb5070e50b17bd03f1de50c64c54b0562da8f71817b12a92f364","observation_id":"31e03873-e1f0-4215-94d9-6e52937bf939","resolution":{"observed_at":"2026-08-07T14:37:01.939588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12570","last_updated":"2025-01-29T03:11:03Z","snapshot_observed_at":"2026-08-10T17:00:34.555363Z","submitted_at":"2025-01-22T01:35:11Z","title":"O1-Pruner: Length-Harmonizing Fine-Tuning for O1-Like Reasoning Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12570","snapshot_observed_at":"2026-08-07T14:37:01.996062Z","title":"O1-pruner: Length-harmonizing fine-tuning for o1-like reasoning pruning.arXiv preprint arXiv:2501.12570, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:01.996062Z"},"links":{"cited_paper":"/paper/2501.12570","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:b030f8d6074d5b79e499a0a7c4f92d65f62dea0d1ad65a6948b16da07a41099e","observation_id":"be441b8d-1204-4559-8db8-fb50648a4f2a","resolution":{"observed_at":"2026-08-07T14:37:01.996062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:04.258006Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":"97e0ab3f-a24d-448c-b13e-c5e0219a3b01","year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.066745Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:b30f08b2b483ec158629a8e135cbabc928c4781c336a06817aa24528af198f5c","observation_id":"1076a454-ec4d-4c8c-b4cb-24c664984679","resolution":{"observed_at":"2026-08-07T14:37:04.310465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09413","last_updated":"2024-12-22T10:44:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-12T16:20:36Z","title":"Imitate, Explore, and Self-Improve: A Reproduction Report on Slow-thinking Reasoning Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09413","snapshot_observed_at":"2026-08-07T14:37:02.150424Z","title":"Imitate, explore, and self-improve: A reproduction report on slow-thinking reasoning systems.arXiv preprint arXiv:2412.09413, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.150424Z"},"links":{"cited_paper":"/paper/2412.09413","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:c6b69d0d1f541eae58f85015893b8141f8938c740acf759365d141ece8db62bf","observation_id":"505ccb87-69d6-4fee-9cd0-1cc0f6d00f67","resolution":{"observed_at":"2026-08-07T14:37:02.150424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20122","last_updated":"2025-06-10T10:54:28Z","snapshot_observed_at":"2026-08-08T01:06:04.764010Z","submitted_at":"2025-02-27T14:14:50Z","title":"Self-Training Elicits Concise Reasoning in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20122","snapshot_observed_at":"2026-08-07T14:37:02.225034Z","title":"Self-training elicits concise reasoning in large language models.arXiv preprint arXiv:2502.20122, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.225034Z"},"links":{"cited_paper":"/paper/2502.20122","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:b5bd6681946dedf90b622757232f0c9144ed93756aa68dcc1b03b71e6e8d38ea","observation_id":"8e1c8307-a8e8-4f91-836a-98a20af4269f","resolution":{"observed_at":"2026-08-07T14:37:02.225034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.19825","last_updated":"2025-01-23T08:45:52Z","snapshot_observed_at":"2026-08-12T23:13:02.941943Z","submitted_at":"2024-07-29T09:21:52Z","title":"Concise Thoughts: Impact of Output Length on LLM Reasoning and Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.19825","snapshot_observed_at":"2026-08-07T14:37:02.280834Z","title":"Concise thoughts: Impact of output length on llm reasoning and cost.arXiv preprint arXiv:2407.19825, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.280834Z"},"links":{"cited_paper":"/paper/2407.19825","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:a8476376b1cbb9de9fb5512884c1601af91332ea7dd4bf68db1023d731ba56da","observation_id":"abf27e81-4979-46ec-bfe9-c90a609f7654","resolution":{"observed_at":"2026-08-07T14:37:02.280834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:04.149854Z","title":"Learning to reason with llms.https://openai.com/index/learning-to-reason-with-llms/, 2024","venue":null,"work_id":"3071fee6-642b-4638-ba6c-1d31a841fa55","year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.360443Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:da43ae3018171d6728cb4310090a9c90505a974575f31ca0c32211bcac3f3be5","observation_id":"6b90efee-0b7f-4959-addf-336cbe67c12a","resolution":{"observed_at":"2026-08-07T14:37:04.201016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:02.400867Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.400867Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:44e8573b28c5e1d72d56d3d7530a21acab6afe2e25bc89f2509bd8de92c3a06c","observation_id":"60242fa7-0d39-445e-a632-bc67c3386528","resolution":{"observed_at":"2026-08-07T14:37:02.400867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-08-13T04:25:38.282910Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-07T14:37:02.480031Z","title":"Code llama: Open foundation models for code.arXiv preprint arXiv:2308.12950, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.480031Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:eb89117350d12d429baaa7d9574e29925c30d656c76412b2cf284aff180a653b","observation_id":"08aef909-c430-4afe-9729-9393712e7ad7","resolution":{"observed_at":"2026-08-07T14:37:02.480031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T14:37:02.554391Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.554391Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:ac15c91bd7ceb28115a02fac1a761837b3a2541286fcd4a3abb5dc393df230d6","observation_id":"158a1cca-3fa1-41c1-9c31-f17173af4c38","resolution":{"observed_at":"2026-08-07T14:37:02.554391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00127","last_updated":"2025-04-30T18:48:06Z","snapshot_observed_at":"2026-08-07T17:34:13.816265Z","submitted_at":"2025-04-30T18:48:06Z","title":"Between Underthinking and Overthinking: An Empirical Study of Reasoning Length and correctness in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.00127","snapshot_observed_at":"2026-08-07T14:37:02.625061Z","title":"Between underthinking and overthinking: An empirical study of reasoning length and correctness in llms.arXiv preprint arXiv:2505.00127, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.625061Z"},"links":{"cited_paper":"/paper/2505.00127","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:e096e13f11700843a3ed12a8995a2cefe62ff1f627208b0667b90d48211b0fb7","observation_id":"0f4b5653-1520-4686-9390-b95c16d4e23b","resolution":{"observed_at":"2026-08-07T14:37:02.625061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16419","last_updated":"2025-08-21T19:14:40Z","snapshot_observed_at":"2026-08-11T13:10:23.709172Z","submitted_at":"2025-03-20T17:59:38Z","title":"Stop Overthinking: A Survey on Efficient Reasoning for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16419","snapshot_observed_at":"2026-08-07T14:37:02.693985Z","title":"Stop overthinking: A survey on efficient reasoning for large language models.arXiv preprint arXiv:2503.16419, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.693985Z"},"links":{"cited_paper":"/paper/2503.16419","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:ae1c006d4c8af7600e4a18662de8dad98015dd59fc6ea25b9b9a91f5d1d342af","observation_id":"8c121087-817b-458e-85a1-5ec109884a4b","resolution":{"observed_at":"2026-08-07T14:37:02.693985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:04.033976Z","title":"Qwq-32b-preview.https://qwenlm.github.io/blog/qwq-32b-preview/, 2025","venue":null,"work_id":"15c037c1-8c84-4125-97c7-4798e2dd39b5","year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.767940Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:dcb6c20e29e84c676dac510ac3b01dfaba84e1e60ef3317dbc44a5c67d87a443","observation_id":"f35abcbc-a4b1-4f97-bd70-f2bc9589c7f4","resolution":{"observed_at":"2026-08-07T14:37:04.090914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24377","last_updated":"2025-03-31T17:58:07Z","snapshot_observed_at":"2026-08-12T17:17:28.011053Z","submitted_at":"2025-03-31T17:58:07Z","title":"Harnessing the Reasoning Economy: A Survey of Efficient Reasoning for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24377","snapshot_observed_at":"2026-08-07T14:37:02.822409Z","title":"Harnessing the reasoning economy: A survey of efficient reasoning for large language models.arXiv preprint arXiv:2503.24377, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.822409Z"},"links":{"cited_paper":"/paper/2503.24377","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:dcf54961e0489fb7de7d988ffdf7cb669976ddb5d25f9df2a11076e06de085c3","observation_id":"8ee41af2-69d6-45d3-bbe2-f7952706419e","resolution":{"observed_at":"2026-08-07T14:37:02.822409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T14:37:02.885543Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.885543Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:533ca64acbc04d3c6285cf4d77b9ef047f674667026c14d45dd67ceb7bcc8222","observation_id":"91d8a4e6-f946-45b6-a219-4417b9846b2b","resolution":{"observed_at":"2026-08-07T14:37:02.885543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:02.944987Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:02.944987Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:d9963d71a08d678311758d933913673f9b85175fdc24362fe2343bb1d26c1715","observation_id":"9d748111-dfab-45c2-b6bb-fd5012ffa94b","resolution":{"observed_at":"2026-08-07T14:37:02.944987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20641","last_updated":"2025-05-23T02:41:43Z","snapshot_observed_at":"2026-08-07T16:35:15.231599Z","submitted_at":"2025-03-26T15:34:37Z","title":"Unlocking Efficient Long-to-Short LLM Reasoning with Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20641","snapshot_observed_at":"2026-08-07T14:37:03.004066Z","title":"Unlocking efficient long-to-short llm reasoning with model merging.arXiv preprint arXiv:2503.20641, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:03.004066Z"},"links":{"cited_paper":"/paper/2503.20641","citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:1e26b52f3d82f3286df569b347a4176b6bac65fbaabcdf40536d6f2d0c629a55","observation_id":"b3f68f8b-fa53-436f-93dc-151615958a5f","resolution":{"observed_at":"2026-08-07T14:37:03.004066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:03.060411Z","title":"Tokenskip: Controllable chain-of-thought compression in llms.arXiv preprint arXiv:2502.12067, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:03.060411Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:cf2158aba337f47b279ce8348f313392b3498c60233694f41b500fe8406d81d8","observation_id":"1bd1b620-86a1-489e-bec5-64558b313831","resolution":{"observed_at":"2026-08-07T14:37:03.060411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:03.121217Z","title":"Towards thinking-optimal scaling of test-time compute for llm reasoning.arXiv preprint arXiv:2502.18080, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:03.121217Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:166e31c86b8c50c42a407eefcd4339602d46ce235c927b1953e971fc35fc108f","observation_id":"56280a21-99c1-43fe-94e3-d410c4ac50c2","resolution":{"observed_at":"2026-08-07T14:37:03.121217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:37:03.196744Z","title":"Shorterbetter: Guiding reasoning models to find optimal inference length for efficient reasoning.arXiv preprint arXiv:2504.21370, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:37:03.196744Z"},"links":{"citing_paper":"/paper/2505.18298"},"observation_digest":"sha256:0e5f28f09a398c854c4b53f80371c13c8e34f0943cff7b909a26e7a27309551f","observation_id":"68153ac2-28be-4582-9590-89a703dc1273","resolution":{"observed_at":"2026-08-07T14:37:03.196744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.18298","last_updated":"2025-05-23T18:44:46Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T02:08:07.729164Z","submitted_at":"2025-05-23T18:44:46Z","title":"Thinking Fast and Right: Balancing Accuracy and Reasoning Length with Adaptive Rewards"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 8 inbound Pith citation observations for arXiv:2505.18298."}