{"as_of":"2026-08-08T02:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:de91c38ad100d27c6fcbad5c739fcbc8f634eb32df2f4ce26c47e8231451d138","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:11:46.192441Z","state":"measured"},{"denominator":41,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":41,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00396/citation-record","integrity":"/paper/2506.00396/integrity","json":"/paper/2506.00396/citation-record.json","paper":"/paper/2506.00396"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:41.751456Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:41.751456Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:72c081df1b259ddb5e42aecf0fcc05152a90546b2ff118fda2ffa1c230a7c61b","observation_id":"f6377368-b056-412a-96ae-e14ccad40c31","resolution":{"observed_at":"2026-08-07T12:11:41.751456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:41.847455Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:41.847455Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:fbb20a031057d8e5a9cf3f66c98a5fef75bb1685aefede5ec9cb56d805090fa2","observation_id":"33a3c908-e5a4-4da1-9430-d564e72bd382","resolution":{"observed_at":"2026-08-07T12:11:41.847455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09687","last_updated":"2024-02-06T18:00:18Z","snapshot_observed_at":"2026-08-06T03:16:16.175894Z","submitted_at":"2023-08-18T17:29:23Z","title":"Graph of Thoughts: Solving Elaborate Problems with Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09687","snapshot_observed_at":"2026-08-07T12:11:42.045200Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.045200Z"},"links":{"cited_paper":"/paper/2308.09687","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:289e1ab66e1a8b27f9d923c8b72ac51ab562bfb37b94bbb8b1eaf4c0cded4b8c","observation_id":"f4499d80-d173-495d-aa62-b5e11faf4df3","resolution":{"observed_at":"2026-08-07T12:11:42.045200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.01318","last_updated":"2023-02-02T18:44:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-02T18:44:11Z","title":"Accelerating Large Language Model Decoding with Speculative Sampling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.01318","snapshot_observed_at":"2026-08-07T12:11:42.178654Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.178654Z"},"links":{"cited_paper":"/paper/2302.01318","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:d0e665f19aabd91b9a742c45107537e31a178cf69c9676ea4d51fbd271431b02","observation_id":"a774c6f8-9cbb-4f70-a7eb-df45b99c2156","resolution":{"observed_at":"2026-08-07T12:11:42.178654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.00122","last_updated":"2022-05-07T07:52:39Z","snapshot_observed_at":"2026-07-06T11:43:15.244747Z","submitted_at":"2021-09-01T00:08:14Z","title":"FinQA: A Dataset of Numerical Reasoning over Financial Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.00122","snapshot_observed_at":"2026-08-07T12:11:42.331835Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.331835Z"},"links":{"cited_paper":"/paper/2109.00122","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:1f260b3ae1fdf9f1a84476b48562ce1d55f5997bc6b2462a722b6b1256458c6a","observation_id":"cc94f70a-b3fa-48af-abc8-c7a354fcb0f0","resolution":{"observed_at":"2026-08-07T12:11:42.331835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-07T12:11:42.497773Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.497773Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:52e838db8a8dc0833bc9b1d2c0582435c97a8fb24e2ef681d2951a3727fa9fb3","observation_id":"7a086ed3-0756-41da-896f-065a4a73b3f6","resolution":{"observed_at":"2026-08-07T12:11:42.497773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.755617Z","title":null,"venue":null,"work_id":"632af8d4-bd61-40c8-9d2c-85f10752873b","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.637601Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:13fd032a0ab26601d32d28478a5c0c2ceac13f3f1de90518705fe5afa85c3c03","observation_id":"95746e22-c505-4434-a73e-f0f025859af1","resolution":{"observed_at":"2026-08-07T12:11:48.912689Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04254","last_updated":"2024-02-23T15:09:58Z","snapshot_observed_at":"2026-08-07T06:38:06.014745Z","submitted_at":"2023-11-07T12:30:36Z","title":"Everything of Thoughts: Defying the Law of Penrose Triangle for Thought Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04254","snapshot_observed_at":"2026-08-07T12:11:42.761281Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.761281Z"},"links":{"cited_paper":"/paper/2311.04254","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:1409e3bc71d861f4b0072d5adf5d07da5ceb93c40e0611567fd3362075d796a1","observation_id":"4bb8b3b9-fc0f-4f72-a8fd-e7e244cb4162","resolution":{"observed_at":"2026-08-07T12:11:42.761281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:11:42.881590Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:42.881590Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:0e548adcad1b698ff91256c8928cf1d083cf8f18346e671e251284537ea5aea2","observation_id":"4e2df33f-7c43-4e80-bbd8-fd38cc1f67d5","resolution":{"observed_at":"2026-08-07T12:11:42.881590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14992","last_updated":"2023-10-23T07:24:28Z","snapshot_observed_at":"2026-07-06T15:32:25.931739Z","submitted_at":"2023-05-24T10:28:28Z","title":"Reasoning with Language Model is Planning with World Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14992","snapshot_observed_at":"2026-08-07T12:11:43.039389Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.039389Z"},"links":{"cited_paper":"/paper/2305.14992","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:2524bac798234d17645e19eb178a1a5ed53ab9e94911bba7f04d6663b0109e71","observation_id":"188d4c1d-6f1a-4d79-a559-54be10710330","resolution":{"observed_at":"2026-08-07T12:11:43.039389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-07T12:11:43.197324Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.197324Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:efa7be7919798091bb5e500be3d6a746cb5f89a4e4829dfad8cf0fb9b0218cb9","observation_id":"75a67c94-5ce5-4074-bbb4-7174c7500b37","resolution":{"observed_at":"2026-08-07T12:11:43.197324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.435891Z","title":null,"venue":null,"work_id":"bbf3af11-a763-495c-8be4-82dbfebe9f08","year":2016},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.343195Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:38cea3a35d926eeb815d8f023b5d8f807aeb2d649d5297a0a40bf19afc3d3378","observation_id":"bb996b5b-de16-4817-a101-d0dafa3b1dfe","resolution":{"observed_at":"2026-08-07T12:11:48.581873Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00001","last_updated":"2023-02-27T22:09:35Z","snapshot_observed_at":"2026-08-01T18:07:54.809322Z","submitted_at":"2023-02-27T22:09:35Z","title":"Reward Design with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.00001","snapshot_observed_at":"2026-08-07T12:11:43.508406Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.508406Z"},"links":{"cited_paper":"/paper/2303.00001","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:7b0efd40db2712945a8c6d70302effdcb5b4dc4c8297fc5ec8185b22c4daae6c","observation_id":"cd972443-e59a-40ce-b06d-3303f40eea88","resolution":{"observed_at":"2026-08-07T12:11:43.508406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.274464Z","title":null,"venue":null,"work_id":"82318fd5-aafb-4323-a5e1-4a6cd8aa408f","year":2019},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.663834Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:3c3aec18baf585b344682e4f192680b7a5dd1b83bf02a8f963a9118ab3309185","observation_id":"ac6ecb87-4432-4707-b893-a0045ec5f7c2","resolution":{"observed_at":"2026-08-07T12:11:48.348430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:48.002821Z","title":null,"venue":null,"work_id":"0fad8f5c-d8c8-49fe-af47-5dc8464dd49e","year":2017},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.827341Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:636626c77e3cbd172f4222d7bab4ee47af1232e7878ce106f315dc24171de778","observation_id":"62239cb0-9347-4121-8d7d-05f951a4c1c9","resolution":{"observed_at":"2026-08-07T12:11:48.144129Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:11:43.975924Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:43.975924Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:09c38fcce347a3211c09992af5bcb17a7a5a21e784e38a219f09e64d3797d58b","observation_id":"73869741-03f6-4365-8c9b-9dc415079e0e","resolution":{"observed_at":"2026-08-07T12:11:43.975924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.860821Z","title":null,"venue":null,"work_id":"434b5283-2af0-454f-8f3f-91f8ecc6480f","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.122879Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:0db0af0672b86cb9c92eb9b40bd968b1a70ec2c50dd28652d2d5f9f23bd40062","observation_id":"4055b49f-ec1b-4352-84a0-f9ce9dd6a23b","resolution":{"observed_at":"2026-08-07T12:11:47.926136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.221997Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.221997Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:f600e85ca893c6676e82f222f281e1a3913145cce7dd33a48347009eca2e4956","observation_id":"49912d8b-c8cf-4072-bdc1-e0727f766815","resolution":{"observed_at":"2026-08-07T12:11:44.221997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.370193Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.370193Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:1ddcaebfe0f6e3b8bd04da01ad3dcc63b93e804a32bf8241279bda606c95e9da","observation_id":"65b26389-f98b-4547-aab2-6754cc213b0b","resolution":{"observed_at":"2026-08-07T12:11:44.370193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.689793Z","title":null,"venue":null,"work_id":"20e5d16f-19e8-4d66-89be-8fe204a8b2ff","year":1990},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.457847Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:b6e2c0a621121afd5b790bc9f0096be5ea951dbd1fef904dea7189ef8f381ff8","observation_id":"a4790b78-16e9-45ec-bb8b-b429c0fc16df","resolution":{"observed_at":"2026-08-07T12:11:47.759436Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07199","last_updated":"2024-08-13T20:52:13Z","snapshot_observed_at":"2026-08-01T22:07:45.419539Z","submitted_at":"2024-08-13T20:52:13Z","title":"Agent Q: Advanced Reasoning and Learning for Autonomous AI Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07199","snapshot_observed_at":"2026-08-07T12:11:44.548976Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.548976Z"},"links":{"cited_paper":"/paper/2408.07199","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:5eeeea5706cdaf4a3ccb97319c5841e4d46b5102309beeab0fa54765fb00ee5b","observation_id":"b9aaa710-1c47-41ed-9dd1-89d68d6435ff","resolution":{"observed_at":"2026-08-07T12:11:44.548976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.662344Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.662344Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:6731592df2eec9a7294af9ec099fa06eecda81b61a81f3119805692f60da39b2","observation_id":"fdbd1863-aabd-4658-bf01-a14a595989a2","resolution":{"observed_at":"2026-08-07T12:11:44.662344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.531384Z","title":null,"venue":null,"work_id":"ee570f09-b255-46e0-8bc6-efa29f6b1d5a","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.725755Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:1b23dd3f9b9a1a683e37cb40076132d2a07e2bacec1729142243de8dac2a185e","observation_id":"b52a0d0b-9606-428e-8a7f-0f4c3a020837","resolution":{"observed_at":"2026-08-07T12:11:47.595645Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T12:11:44.810602Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.810602Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:917850c57387227aabdb190e788ed351ffbe7a9268dd6f54e9bcc15e5f14c057","observation_id":"25ecfa1a-a068-49e0-beea-9488145e4ca5","resolution":{"observed_at":"2026-08-07T12:11:44.810602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:44.904533Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.904533Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:c90f6dd4f20ae78a33ffd59e2c3f80be41dc3527071ab4267481cfd66cabf268","observation_id":"54b69683-c3c1-46c1-919f-080e91e0a93d","resolution":{"observed_at":"2026-08-07T12:11:44.904533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T12:11:44.977819Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:44.977819Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:ceb903e74745dd481446bf5f72f122fb82d9ae4ca4b07f0b0ba0680a977c74db","observation_id":"20b8ee25-6ca8-437f-a48c-90b04c7aca29","resolution":{"observed_at":"2026-08-07T12:11:44.977819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03124","last_updated":"2025-06-28T12:31:45Z","snapshot_observed_at":"2026-08-07T08:05:38.374743Z","submitted_at":"2025-01-06T16:31:45Z","title":"PRMBench: A Fine-grained and Challenging Benchmark for Process-Level Reward Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03124","snapshot_observed_at":"2026-08-07T12:11:45.058024Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.058024Z"},"links":{"cited_paper":"/paper/2501.03124","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:517f84275bd637a4deea7b2faa7e64936d4963203b8e1a4c32c64f4786f5787a","observation_id":"22ae8d7f-691c-417f-975f-b2e50f5f1b5c","resolution":{"observed_at":"2026-08-07T12:11:45.058024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:11:45.120617Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.120617Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:f5a6da83f33d0551f5f1ea82798802ed9fc633f3eb786b914be1bd1242ca19cf","observation_id":"06ebea2b-a996-450d-90de-d4a4cf82c051","resolution":{"observed_at":"2026-08-07T12:11:45.120617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.231234Z","title":null,"venue":null,"work_id":"2a19ff90-3320-40c9-b380-6d53eed1418e","year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.183971Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:d5a7b5fd823ca6fc796a98e67d9927638b79f973e36c6957c0be2cd8b2020259","observation_id":"4dce3f3e-4cef-4567-9e38-923e7a5aaa63","resolution":{"observed_at":"2026-08-07T12:11:47.282226Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:45.260583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.260583Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:378170ca3c7c9df6d5ed637b94f053a0dea9fe9cee0207aff7156e5748757855","observation_id":"58fb2e04-6789-4528-ab20-838d42e59af2","resolution":{"observed_at":"2026-08-07T12:11:45.260583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T12:11:45.365323Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.365323Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:bc5c744db23ebe764444b4130eb364e8458655adbd9a283a27da4512b89f1412","observation_id":"00d41d8c-0668-40df-9829-13e3d9fee315","resolution":{"observed_at":"2026-08-07T12:11:45.365323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04398","last_updated":"2024-01-19T01:05:05Z","snapshot_observed_at":"2026-08-08T00:41:28.628631Z","submitted_at":"2024-01-09T07:46:26Z","title":"Chain-of-Table: Evolving Tables in the Reasoning Chain for Table Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04398","snapshot_observed_at":"2026-08-07T12:11:45.444335Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.444335Z"},"links":{"cited_paper":"/paper/2401.04398","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:ec73f764e75a9680c99a293c9b2f8842c18c74fcf756a127f05e3245887e80e0","observation_id":"22c6d246-76e5-403c-be61-4cca2e589cfc","resolution":{"observed_at":"2026-08-07T12:11:45.444335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:45.475544Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.475544Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:215b3de592dc8fb52059591792e1bc8333b1c0729b7a2eacb085cd50a1263abb","observation_id":"c97218ba-3f3b-4c83-9e10-22a1c2722c86","resolution":{"observed_at":"2026-08-07T12:11:45.475544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:45.568213Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.568213Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:6ccb8f175d195f7eb4343ff6d6527fe03a4a536edfce91a799c9d6bfeed64874","observation_id":"02aadac5-3a10-41c4-ab28-8da1516f555c","resolution":{"observed_at":"2026-08-07T12:11:45.568213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:47.039428Z","title":null,"venue":null,"work_id":"5fed5b66-1889-4d65-b0df-47f1196fbcda","year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.666401Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:ad47d122ae042b443ca12296e792f95fcba95f577a7a37677b02b669785fd8ff","observation_id":"26fa552f-2b33-4684-9e9a-661ef3c1d765","resolution":{"observed_at":"2026-08-07T12:11:47.096342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-07T12:11:45.751564Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.751564Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:66170af278b40694e55c46e82298beaaff9377d3adf75ba7fc6115b1308c0d40","observation_id":"7e877f1d-7658-4cd9-8983-0f96efd48657","resolution":{"observed_at":"2026-08-07T12:11:45.751564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.915388Z","title":null,"venue":null,"work_id":"bb0eb0fb-72c9-4298-a8b4-f307cf9dee2b","year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.857180Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:f724a99f437d270e5a5428586c58c2df0c931cdf2c092768999b9ab623a103dd","observation_id":"77ab271b-cb31-40fb-a81d-147fbdc2ca4a","resolution":{"observed_at":"2026-08-07T12:11:46.962735Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T12:11:45.942978Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:45.942978Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:88f2dc147a1104816f431e3f7317b587b22b537f242961e3342cce244ba140ff","observation_id":"5d01445e-2841-406d-808a-45f48acc6633","resolution":{"observed_at":"2026-08-07T12:11:45.942978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.019554Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:46.019554Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:35d0a8640868a39f845d36c24c2155bb1d3dd0c0677279bf54d1b60717c13372","observation_id":"fb7fb42d-6cd0-4eca-a422-d9b0e69eddbf","resolution":{"observed_at":"2026-08-07T12:11:46.019554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13227","last_updated":"2023-10-20T02:24:35Z","snapshot_observed_at":"2026-08-07T00:35:09.723451Z","submitted_at":"2023-10-20T02:24:35Z","title":"ToolChain*: Efficient Action Space Navigation in Large Language Models with A* Search","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13227","snapshot_observed_at":"2026-08-07T12:11:46.100639Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:46.100639Z"},"links":{"cited_paper":"/paper/2310.13227","citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:4c87b47a67f85c494805fee4fedae71e563b4b89ab32b677319eb23a4be5349d","observation_id":"23584c56-45e1-40e6-a1e6-fb8c3a2c20d5","resolution":{"observed_at":"2026-08-07T12:11:46.100639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:11:46.738681Z","title":null,"venue":null,"work_id":"1225d780-c52d-428e-a10f-d2792bb6e251","year":2025},"citing_paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:11:46.192441Z"},"links":{"citing_paper":"/paper/2506.00396"},"observation_digest":"sha256:83dd3d8c8aff4c51f6026a2cb6ae2bcd7a2899d3f421a8c7628ab19e018c9d09","observation_id":"cb77b58f-2502-4520-af81-f354e4335d57","resolution":{"observed_at":"2026-08-07T12:11:46.822688Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.00396","last_updated":"2025-05-31T05:32:12Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T00:41:55.641308Z","submitted_at":"2025-05-31T05:32:12Z","title":"Speculative Reward Model Boosts Decision Making Ability of LLMs Cost-Effectively"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 0 inbound Pith citation observations for arXiv:2506.00396."}