{"as_of":"2026-08-08T17:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34834a7876a80e1a96c138f0a166c91349702634bb242b8f4bea8b0477ccab2f","coverage":[{"denominator":92,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":92,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:03:33.393958Z","state":"measured"},{"denominator":103,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":103,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":11,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":11,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:21:41.937333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-06T21:21:41.937333Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.00417","last_updated":"2025-07-01T04:10:15Z","snapshot_observed_at":"2026-08-07T07:50:07.171627Z","submitted_at":"2025-07-01T04:10:15Z","title":"ASTRO: Teaching Language Models to Reason by Reflecting and Backtracking In-Context","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T21:21:41.937333Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2507.00417"},"observation_digest":"sha256:a8d32a9d4cd4978ce749f064d933d10517fc75c832df83b44adb8bc2ac8b4f5f","observation_id":"9749439b-2f45-4577-a302-9162374af12e","resolution":{"observed_at":"2026-08-06T21:21:41.937333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T20:21:08.163389Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.10751","last_updated":"2025-08-14T15:34:47Z","snapshot_observed_at":"2026-08-07T12:11:52.874985Z","submitted_at":"2025-08-14T15:34:47Z","title":"Pass@k Training for Adaptively Balancing Exploration and Exploitation of Large Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T20:21:08.163389Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2508.10751"},"observation_digest":"sha256:7f370a1d1dff244d25b7bcbfe50fe38d393abc102325afb9c61bbe79b42a0212","observation_id":"2dc96f34-873c-4b75-ae35-482082edbde9","resolution":{"observed_at":"2026-08-05T20:21:08.163389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-04T22:59:14.534182Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms.arXiv preprint arXiv:2506.09026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06941","last_updated":"2025-09-08T17:52:56Z","snapshot_observed_at":"2026-08-07T12:11:53.268632Z","submitted_at":"2025-09-08T17:52:56Z","title":"Outcome-based Exploration for LLM Reasoning","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T22:59:14.534182Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2509.06941"},"observation_digest":"sha256:6403978e8d0d13ca49d147c883626c29c71b5f7c4525fed5ca48807ec5ed77e7","observation_id":"62e79bd9-5de4-4b91-b579-44a002b56daf","resolution":{"observed_at":"2026-08-04T22:59:14.534182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-04T10:09:03.509893Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms.arXiv preprint arXiv:2506.09026,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.11686","last_updated":"2026-07-15T17:43:29Z","snapshot_observed_at":"2026-08-08T16:17:52.499482Z","submitted_at":"2025-10-13T17:49:05Z","title":"Representation-Based Exploration for Language Models: From Test-Time to Post-Training","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T10:09:03.509893Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2510.11686"},"observation_digest":"sha256:c94a28d5d53aa4f1b6f2853830a0fb1f8cdc39b6952968a30e5dae951d2a0ced","observation_id":"6a1e0385-5950-46db-a390-5826abdc1213","resolution":{"observed_at":"2026-08-04T10:09:03.509893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2601.20829","last_updated":"2026-05-09T10:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-28T18:29:21Z","title":"Training Reasoning Models on Saturated Problems via Failure-Prefix Conditioning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T10:26:45.961575Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2601.20829"},"observation_digest":"sha256:ab8a734c6c922fd921f391d69febfd027ef17a9f2b7e3207ec3e5137f9544101","observation_id":"ac25798b-d911-4be4-9de9-432a70e14263","resolution":{"observed_at":"2026-05-16T10:27:44.448791Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:ef44aa2b8d4a3f70e36fe02f0da87d0fa31546aeabb58ee6cdd09b820291dc74","observation_id":"96a65a17-114f-4a3b-9585-6ae340cd7f01","resolution":{"observed_at":"2026-05-15T16:36:17.923996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2604.18493","last_updated":"2026-04-20T16:43:28Z","snapshot_observed_at":"2026-08-07T12:08:03.856446Z","submitted_at":"2026-04-20T16:43:28Z","title":"Too Correct to Learn: Reinforcement Learning on Saturated Reasoning Data","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:32:23.972335Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2604.18493"},"observation_digest":"sha256:d52bf82b6bdce902c85a1ea8763733c99c30ab3b1014d49c865d43253918b9cc","observation_id":"97b7fe68-7dfb-4165-bc4e-0cade0795304","resolution":{"observed_at":"2026-05-10T05:36:01.402466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":1},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-08T18:48:56.075160Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:40295b657e7b263cf399043749e16b858f9d07e8772e8bb78048e21b3d6bae78","observation_id":"11b5d117-b3eb-4c77-8be0-13e8c12225c7","resolution":{"observed_at":"2026-05-09T06:10:42.517079Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2605.03065","last_updated":"2026-06-26T00:04:01Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:36:40Z","title":"OGPO: Sample Efficient Full-Finetuning of Generative Control Policies","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T00:02:55.449923Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2605.03065"},"observation_digest":"sha256:bc2f10101d258fed094c5f2d621c6085d58f50a44c2d33429897f074ac48198a","observation_id":"9de63b67-d0db-426d-ae15-87987fce5a98","resolution":{"observed_at":"2026-07-01T00:05:09.652333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06080","last_updated":"2026-06-04T12:16:39Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:16:39Z","title":"On Advantage Estimates for Max@K Policy Gradients","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T02:21:57.143016Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06080"},"observation_digest":"sha256:c24abe6d29159251849613152e90f0485aebc4c59cd6aa3d7fa537c12d6007eb","observation_id":"978bf51c-3054-476a-bfff-6e3746dd43dd","resolution":{"observed_at":"2026-07-02T12:06:56.433620Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"cited_work":{"arxiv_id":"2506.09026","doi":"10.48550/arxiv.2506.09026","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.09026","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"e3: Learning to explore enables extrapolation of test-time compute for llms","venue":"ArXiv.org","work_id":"fb28d4ba-7034-4f2c-9abc-59eecf57cc95","year":2025},"citing_paper":{"arxiv_id":"2606.06096","last_updated":"2026-06-04T12:34:15Z","snapshot_observed_at":"2026-07-06T23:46:01.165261Z","submitted_at":"2026-06-04T12:34:15Z","title":"OrderGrad: Optimizing Beyond the Mean with Order-Statistic Policy Gradient Estimation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T02:17:30.974692Z"},"links":{"cited_paper":"/paper/2506.09026","citing_paper":"/paper/2606.06096"},"observation_digest":"sha256:e6a2932d4c156960c7fa7d22abbdf5cc4a7af7af8996a4b71b64d821ed3c2dd0","observation_id":"18fc5695-e22c-4d53-9796-fff3c94285ae","resolution":{"observed_at":"2026-07-02T12:16:56.964580Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.09026/citation-record","integrity":"/paper/2506.09026/integrity","json":"/paper/2506.09026/citation-record.json","paper":"/paper/2506.09026"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:25.231877Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift.Journal of Machine Learning Research, 22(98):1–76, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.231877Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8ee714eff62472863ed9734cd7b79f967deb9466872dcd5e99577c2bdbdd27d0","observation_id":"563ffcf9-a85f-4873-935f-8451d9f9cbf1","resolution":{"observed_at":"2026-08-07T05:03:25.231877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04697","last_updated":"2025-10-03T01:55:58Z","snapshot_observed_at":"2026-08-06T08:53:09.095000Z","submitted_at":"2025-03-06T18:43:29Z","title":"L1: Controlling How Long A Reasoning Model Thinks With Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04697","snapshot_observed_at":"2026-08-07T05:03:25.293292Z","title":"L1: Controlling how long a reasoning model thinks with reinforcement learning.arXiv preprint arXiv:2503.04697, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.293292Z"},"links":{"cited_paper":"/paper/2503.04697","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:73df7cba149540c0bf5815a62aa9314f4a011d147a5889f002fc3dc2d1f43fa8","observation_id":"bef38348-1375-4b6c-84e8-f52d09fd0b6d","resolution":{"observed_at":"2026-08-07T05:03:25.293292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14740","last_updated":"2024-02-26T18:26:25Z","snapshot_observed_at":"2026-07-06T17:34:07.737296Z","submitted_at":"2024-02-22T17:52:34Z","title":"Back to Basics: Revisiting REINFORCE Style Optimization for Learning from Human Feedback in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14740","snapshot_observed_at":"2026-08-07T05:03:25.334902Z","title":"Back to basics: Revisiting reinforce style optimization for learning from human feedback in llms.arXiv preprint arXiv:2402.14740, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.334902Z"},"links":{"cited_paper":"/paper/2402.14740","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ea4ff5d92ecb18a3e4b2d3645169759dea7190825f1fb49d79e3caff2a1f3424","observation_id":"dadfa8ab-d078-4d79-bdbd-7b99b5afe111","resolution":{"observed_at":"2026-08-07T05:03:25.334902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-08-08T11:58:24.516369Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-07T05:03:25.373350Z","title":"Evaluating large language models trained on code.arXiv preprint arXiv:2107.03374, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.373350Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:59f586ffb92e8465c2416b3325265a5102bc82fa12ddff021d63471c066793da","observation_id":"75d7da3b-4d43-4d9b-8a91-a506884db8d7","resolution":{"observed_at":"2026-08-07T05:03:25.373350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:25.417829Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.417829Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0ffaf71e92cc2e92d95cdbafba8d66935f0bd6fb53492957481b523ebf6925a2","observation_id":"d8abdacc-97b9-40be-8a4e-b4f4c1bcec04","resolution":{"observed_at":"2026-08-07T05:03:25.417829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-02T07:58:55.035919Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-07T05:03:25.549636Z","title":"Rl2: Fast reinforcement learning via slow reinforcement learning.arXiv preprint arXiv:1611.02779, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.549636Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:39d9592a5187956faf9026c5561f41a858cfa659441ca9d40b8fe19d1442224a","observation_id":"34bfbdea-a97e-407a-aa9e-0084dca6ec06","resolution":{"observed_at":"2026-08-07T05:03:25.549636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:25.613833Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.613833Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:30c2cbe4e98f04a7f07ed7d1187e76a75171dc3c5527e6b0f0e2806f6a42b201","observation_id":"50086ad2-4bd5-4074-a2df-9092189d01b8","resolution":{"observed_at":"2026-08-07T05:03:25.613833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-06T11:34:00.528900Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-07T05:03:25.660715Z","title":"Stream of search (sos): Learning to search in language.arXiv preprint arXiv:2404.03683, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.660715Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:2dfa440def536edb1bb33c9034b1f6b1e023d0940c4bccd6ea03adc611df740f","observation_id":"3dbd99e9-5309-4290-99df-a3a249b670c8","resolution":{"observed_at":"2026-08-07T05:03:25.660715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-07-06T20:45:32.493589Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-07T05:03:25.755143Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.755143Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c90da4f9ec0fc4d9296b9f696010f8e2e7f08717e58fc4bf04d300d91c7d84ed","observation_id":"b874ac4e-68f7-4292-9003-d210c3136e34","resolution":{"observed_at":"2026-08-07T05:03:25.755143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12894","last_updated":"2019-07-30T13:31:07Z","snapshot_observed_at":"2026-07-06T08:11:09.285762Z","submitted_at":"2019-07-30T13:31:07Z","title":"Reward Learning for Efficient Reinforcement Learning in Extractive Document Summarisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12894","snapshot_observed_at":"2026-08-07T05:03:25.809592Z","title":"Reward learning for efficient reinforcement learning in extractive document summarisation.arXiv preprint arXiv:1907.12894, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.809592Z"},"links":{"cited_paper":"/paper/1907.12894","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:22eca10b17e3deb0088d193cce74681ff751296ed663bf724cf605abe8161207","observation_id":"dc605c3a-310f-4ff3-9b8f-329b499d21c4","resolution":{"observed_at":"2026-08-07T05:03:25.809592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06277","last_updated":"2021-07-13T17:59:25Z","snapshot_observed_at":"2026-08-04T15:41:14.838865Z","submitted_at":"2021-07-13T17:59:25Z","title":"Why Generalization in RL is Difficult: Epistemic POMDPs and Implicit Partial Observability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06277","snapshot_observed_at":"2026-08-07T05:03:25.861972Z","title":"Adams, and Sergey Levine","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.861972Z"},"links":{"cited_paper":"/paper/2107.06277","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:69b95acccf518b463b4a68282dd53269c1c6f591d401ddade4fe26953a511206","observation_id":"5601a49a-b4a1-448d-b99c-c8f541ae153c","resolution":{"observed_at":"2026-08-07T05:03:25.861972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.04640","last_updated":"2020-04-30T16:55:56Z","snapshot_observed_at":"2026-07-06T06:44:25.518684Z","submitted_at":"2018-06-12T16:48:52Z","title":"Unsupervised Meta-Learning for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.04640","snapshot_observed_at":"2026-08-07T05:03:25.925948Z","title":"Unsupervised meta- learning for reinforcement learning.CoRR, abs/1806.04640, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.925948Z"},"links":{"cited_paper":"/paper/1806.04640","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:92d74ac4bf8872e6676606647de3f8778053d293a556b9155980bbd583067603","observation_id":"5ee39a6f-de9c-45e7-b557-533f155b25a5","resolution":{"observed_at":"2026-08-07T05:03:25.925948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02690","last_updated":"2019-01-26T01:54:32Z","snapshot_observed_at":"2026-08-05T14:48:12.142477Z","submitted_at":"2018-12-06T18:15:44Z","title":"Provably Efficient Maximum Entropy Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02690","snapshot_observed_at":"2026-08-07T05:03:25.984106Z","title":"Provably efficient maximum entropy exploration","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.984106Z"},"links":{"cited_paper":"/paper/1812.02690","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:95eeacf495a6fcc955283eaff3e864eaafa14a54a0cf9d4bc05abe112f98849b","observation_id":"be508c46-43de-44ef-ad57-19332c637362","resolution":{"observed_at":"2026-08-07T05:03:25.984106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.061189Z","title":"A sober look at progress in language model reasoning: Pitfalls and paths to reproducibility","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.061189Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:69ffb69a2b02cbf6f94abe1ea71bb57ed0c375b2c7c2796581aad770c4cf679a","observation_id":"fa5bae73-d49d-4d36-a620-4458f701bdf4","resolution":{"observed_at":"2026-08-07T05:03:26.061189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01951","last_updated":"2024-12-04T14:20:21Z","snapshot_observed_at":"2026-08-08T15:09:24.533531Z","submitted_at":"2024-12-02T20:24:17Z","title":"Self-Improvement in Language Models: The Sharpening Mechanism","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01951","snapshot_observed_at":"2026-08-07T05:03:26.163556Z","title":"Self-improvement in language models: The sharpening mechanism","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.163556Z"},"links":{"cited_paper":"/paper/2412.01951","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:1923904ff9068161c75590fc98b0c3091053278f8c68ab4fae0b8024afdb48cf","observation_id":"2244849d-c21a-4ff2-82fb-0ec8ec7e670a","resolution":{"observed_at":"2026-08-07T05:03:26.163556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19877","last_updated":"2026-07-16T03:37:34Z","snapshot_observed_at":"2026-08-08T12:26:31.053048Z","submitted_at":"2025-03-25T17:41:18Z","title":"Scaling Evaluation-time Compute with Reasoning Models as Evaluators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19877","snapshot_observed_at":"2026-08-07T05:03:26.243355Z","title":"Scaling evaluation-time compute with reasoning models as process evaluators.arXiv preprint arXiv:2503.19877, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.243355Z"},"links":{"cited_paper":"/paper/2503.19877","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:7c5ed5e778b117c7d7bd5db052ec257526184bda082e7f4a278a64daeea5b0e6","observation_id":"55ff2b50-c5fd-4950-a02b-65d83d0fd24a","resolution":{"observed_at":"2026-08-07T05:03:26.243355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15371","last_updated":"2024-10-28T19:55:46Z","snapshot_observed_at":"2026-07-06T17:49:07.589781Z","submitted_at":"2024-03-22T17:50:43Z","title":"Can large language models explore in-context?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15371","snapshot_observed_at":"2026-08-07T05:03:26.307343Z","title":"Can large language models explore in-context?arXiv preprint arXiv:2403.15371, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.307343Z"},"links":{"cited_paper":"/paper/2403.15371","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8b912253694c886e03fbcf0637778cf54d7c0f42fa35d90b57c12e22c5ed7759","observation_id":"c14075a3-af6b-4cea-a2df-df48b7991ca5","resolution":{"observed_at":"2026-08-07T05:03:26.307343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12917","last_updated":"2024-10-04T17:28:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-19T17:16:21Z","title":"Training Language Models to Self-Correct via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12917","snapshot_observed_at":"2026-08-07T05:03:26.372345Z","title":"Training language models to self-correct via reinforcement learning.arXiv preprint arXiv:2409.12917, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.372345Z"},"links":{"cited_paper":"/paper/2409.12917","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:fb35a4f179f4d2f1c44218a67201dacaf58845cdeb269ba17b3f896d72456d17","observation_id":"12a9a868-d0cd-4408-b1a8-34f7e025060a","resolution":{"observed_at":"2026-08-07T05:03:26.372345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12809","last_updated":"2023-06-18T02:13:46Z","snapshot_observed_at":"2026-07-06T14:34:45.638666Z","submitted_at":"2022-12-24T19:46:47Z","title":"Understanding the Complexity Gains of Single-Task RL with a Curriculum","version":3},"cited_work":{"arxiv_id":"2212.12809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2212.12809","snapshot_observed_at":"2026-08-07T05:03:34.296282Z","title":"Understanding the Complexity Gains of Single-Task RL with a Curriculum","venue":"cs.LG","work_id":"f74091d2-676d-4d46-bbeb-cac5e9ba5b42","year":2022},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.430721Z"},"links":{"cited_paper":"/paper/2212.12809","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:3fa90be23da138250849370f4b5da2bddfe24ce35cf1796a2aba56b434a57830","observation_id":"6951c05a-5e10-4317-a2a4-0976c4bd09f1","resolution":{"observed_at":"2026-08-07T05:03:34.373383Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02060","last_updated":"2024-06-12T02:46:16Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T15:59:11Z","title":"Long-context LLMs Struggle with Long In-context Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02060","snapshot_observed_at":"2026-08-07T05:03:26.464454Z","title":"Long-context llms struggle with long in-context learning.arXiv preprint arXiv:2404.02060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.464454Z"},"links":{"cited_paper":"/paper/2404.02060","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:f9c7d9c2b6224cb54f3395671ed3453d1bbbb7686d8eef846fcf335d725bd093","observation_id":"0473c9c2-a41b-4010-bf25-5fd125a256b7","resolution":{"observed_at":"2026-08-07T05:03:26.464454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.05896","last_updated":"2020-07-12T03:33:50Z","snapshot_observed_at":"2026-07-06T09:37:26.668282Z","submitted_at":"2020-07-12T03:33:50Z","title":"Learning Abstract Models for Strategic Exploration and Fast Reward Transfer","version":1},"cited_work":{"arxiv_id":"2007.05896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.05896","snapshot_observed_at":"2026-08-07T05:03:34.030351Z","title":"Learning Abstract Models for Strategic Exploration and Fast Reward Transfer","venue":"cs.LG","work_id":"916ae297-4e6f-4a01-a132-84bef8cd4718","year":2020},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.505425Z"},"links":{"cited_paper":"/paper/2007.05896","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:f9ad57e0b577766a9cc4b0f9104ca3011dbaec3a3a2574cf20ecaea509bf1a3e","observation_id":"b2d64ab7-2198-4b1c-a6c5-4b0a9ea16206","resolution":{"observed_at":"2026-08-07T05:03:34.135617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24864","last_updated":"2025-05-30T17:59:01Z","snapshot_observed_at":"2026-08-07T07:17:16.299213Z","submitted_at":"2025-05-30T17:59:01Z","title":"ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24864","snapshot_observed_at":"2026-08-07T05:03:26.538629Z","title":"Prorl: Prolonged reinforcement learning expands reasoning boundaries in large language models.arXiv preprint arXiv:2505.24864, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.538629Z"},"links":{"cited_paper":"/paper/2505.24864","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ff87748efa54ccde20a75b34b2db4d15b1f80bade8ee9d2c10fa2cb0456ea5be","observation_id":"cfe38482-8f06-465a-97f4-0d92e1ae9e09","resolution":{"observed_at":"2026-08-07T05:03:26.538629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-07T05:03:26.569626Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.569626Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:90323b78e28553b9953f1522d5a703008505d53c59a19fbfebb831fac891c8dc","observation_id":"327cfcbf-ed19-48cf-9796-ee89fe80cad3","resolution":{"observed_at":"2026-08-07T05:03:26.569626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.638436Z","title":"Acemath: Advancing frontier math reasoning with post-training and reward modeling.arXiv preprint, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.638436Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:28d6875e60de2e73dafffcffcd4b8e52e6d90f26bb7ae6042835b4440eb1f8ad","observation_id":"09b53ecd-4144-419a-8716-247b70a4f766","resolution":{"observed_at":"2026-08-07T05:03:26.638436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.690066Z","title":"Deepcoder: A fully open-source 14b coder at o3-mini level, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.690066Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ae43e908a34aeaf1cc0a0b35da41c9eddce4759f7b204a41fa34034a3407976f","observation_id":"92b2fbf2-884b-45a3-b961-3db8c7a8d3c7","resolution":{"observed_at":"2026-08-07T05:03:26.690066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.747061Z","title":"Tang, Manan Roongta, Colin Cai, Jeffrey Luo, Tianjun Zhang, Li Erran Li, Raluca Ada Popa, and Ion Stoica","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.747061Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ddd2b97f7bec132af24fcf9c17ef3a5f59cd49913b555352b7e3eab7a4c4dd27","observation_id":"e4aa8473-3a95-48d6-8c14-8069af19c0fa","resolution":{"observed_at":"2026-08-07T05:03:26.747061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:26.842800Z","title":"s1: Simple test-time scaling,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.842800Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:1bc0be3f9421db6fdc1e4b5fe93d08b6b3e6daa40df4e6b183d6ea4ef8ec4399","observation_id":"10aa9ec4-ba0e-43c5-90e6-19807c442f98","resolution":{"observed_at":"2026-08-07T05:03:26.842800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06238","last_updated":"2025-07-14T15:16:18Z","snapshot_observed_at":"2026-07-06T19:29:55.838200Z","submitted_at":"2024-10-08T17:54:03Z","title":"EVOLvE: Evaluating and Optimizing LLMs For In-Context Exploration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06238","snapshot_observed_at":"2026-08-07T05:03:26.952530Z","title":"Evolve: Evaluating and optimizing llms for exploration.arXiv preprint arXiv:2410.06238, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.952530Z"},"links":{"cited_paper":"/paper/2410.06238","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:eb5a9bc8b378a576c5ee0c940353c34e903294fd68d0dc028eaf5936c0e00809","observation_id":"52911944-a89a-47e7-ae74-3accc39b8d79","resolution":{"observed_at":"2026-08-07T05:03:26.952530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-07T05:03:26.907112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:26.907112Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b1479d782afc59d27e658745c1c6b2f0a377e20376a079a1dae922a891569ae4","observation_id":"c22a6a3f-f6ff-4d52-b80b-d5f983955527","resolution":{"observed_at":"2026-08-07T05:03:26.907112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.22660","last_updated":"2025-06-27T17:25:28Z","snapshot_observed_at":"2026-08-07T12:59:59.342982Z","submitted_at":"2025-05-28T17:59:37Z","title":"Maximizing Confidence Alone Improves Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.22660","snapshot_observed_at":"2026-08-07T05:03:27.075191Z","title":"Maximizing confidence alone improves reasoning.arXiv preprint arXiv:2505.22660, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.075191Z"},"links":{"cited_paper":"/paper/2505.22660","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6c55bec1e336da0b2f194b4ff37d6458825e94f42e82c0906a02db5eeecda361","observation_id":"a5ee57e0-46a5-4534-b3f4-40b377ee033f","resolution":{"observed_at":"2026-08-07T05:03:27.075191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T05:03:27.026991Z","title":"Openai o1 system card, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.026991Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:92464eedec4cd64967bfb19704d63b425eda3e633d4b5f4194a350a2f17e4cf6","observation_id":"7788e3dc-c34d-47d8-9433-c4febbdd1c91","resolution":{"observed_at":"2026-08-07T05:03:27.026991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.114011Z","title":"Optimizing anytime reasoning via budget relative policy optimization.arXiv preprint arXiv:2505.13438, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.114011Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:05ad16b6af770bdbcee612450e0e078b76db1862503e3f9c66f35de9f86f4bef","observation_id":"9501d6f4-81d4-425f-9b26-ef0835d084cd","resolution":{"observed_at":"2026-08-07T05:03:27.114011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.081368Z","title":"John Wiley & Sons, Inc., 1994","venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.081368Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:9cb12ccf779f16a9416dca77ff8e6e554df477e2e548eb6ce3951281eaa012a6","observation_id":"82baf72a-03f8-433d-926d-851f97505323","resolution":{"observed_at":"2026-08-07T05:03:27.081368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07572","last_updated":"2025-03-10T17:40:43Z","snapshot_observed_at":"2026-08-07T17:16:00.148793Z","submitted_at":"2025-03-10T17:40:43Z","title":"Optimizing Test-Time Compute via Meta Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07572","snapshot_observed_at":"2026-08-07T05:03:27.410502Z","title":"Optimizing test-time compute via meta reinforcement fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.410502Z"},"links":{"cited_paper":"/paper/2503.07572","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:1461cb035ded8033071228f1e30bc4f9d2b84cee6660cbb30bccd1809fe5f158","observation_id":"83245270-4548-4a11-8767-ddf00921963f","resolution":{"observed_at":"2026-08-07T05:03:27.410502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18219","last_updated":"2024-07-26T17:50:27Z","snapshot_observed_at":"2026-08-07T12:10:53.303603Z","submitted_at":"2024-07-25T17:35:59Z","title":"Recursive Introspection: Teaching Language Model Agents How to Self-Improve","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18219","snapshot_observed_at":"2026-08-07T05:03:27.330777Z","title":"Recursive introspection: Teaching language model agents how to self-improve.arXiv preprint arXiv:2407.18219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.330777Z"},"links":{"cited_paper":"/paper/2407.18219","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ae9a549ce7098beeaf4a7232263f7fd7c061299082bcfcba1b9f0622ac336106","observation_id":"93881a94-72c1-4b83-815f-b6aa2f1a469a","resolution":{"observed_at":"2026-08-07T05:03:27.330777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08146","last_updated":"2024-10-10T17:31:23Z","snapshot_observed_at":"2026-08-02T06:08:09.777151Z","submitted_at":"2024-10-10T17:31:23Z","title":"Rewarding Progress: Scaling Automated Process Verifiers for LLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08146","snapshot_observed_at":"2026-08-07T05:03:27.538173Z","title":"Rewarding progress: Scaling automated process verifiers for llm reasoning.arXiv preprint arXiv:2410.08146, 2024","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.538173Z"},"links":{"cited_paper":"/paper/2410.08146","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:afd6be5e08282e1272a75a3ff46437ce2e6aae2d335b3a8f61ad9e1bd7ab277f","observation_id":"1782b1e6-2e5d-4e88-bd43-c2cc14ef8572","resolution":{"observed_at":"2026-08-07T05:03:27.538173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-07T05:03:27.481185Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.481185Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b0360b99d39b2105c7fb99a01853bde717a0811a31bf57bd06e85632b348a0f1","observation_id":"7082dd8b-ab49-4565-b43e-4b6fa9fd41ce","resolution":{"observed_at":"2026-08-07T05:03:27.481185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:03:27.653994Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.653994Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:452517ae4d9eb5b632bbf9a6b20a6e063b8b06f4d59aba6b4a570fcae300cb22","observation_id":"d155d0d9-b405-46c5-9231-8f57d771e0eb","resolution":{"observed_at":"2026-08-07T05:03:27.653994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.601303Z","title":"Opti- mizing llm test-time compute involves solving a meta-rl problem.https://blog.ml.cmu.edu/,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.601303Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:11030881b417bf2733fdf9503ebdf66e00ef7d0d6c511f3cac1dba7d63f0a761","observation_id":"8ba954c4-8f3f-4ec8-8b34-bcad6404e7b1","resolution":{"observed_at":"2026-08-07T05:03:27.601303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.887825Z","title":"Spurious rewards: Rethinking training signals in rlvr, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.887825Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d3eb90975f6bc2f2b49413baab06d024285f200d6ee4a49c9ebd9b9157bda4ae","observation_id":"93354397-44c3-457a-8c2b-ad6a5463736c","resolution":{"observed_at":"2026-08-07T05:03:27.887825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:27.763477Z","title":"Can large reasoning models self-train?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.763477Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8d912699d78920c55e11c5d03d72b506e2af8cb9efc5a1e9ce079eb0c1c94507","observation_id":"aed5a159-d96f-420e-8049-51292198c6ff","resolution":{"observed_at":"2026-08-07T05:03:27.763477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19256","last_updated":"2024-10-02T04:01:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-28T06:20:03Z","title":"HybridFlow: A Flexible and Efficient RLHF Framework","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19256","snapshot_observed_at":"2026-08-07T05:03:28.093876Z","title":"Hybridflow: A flexible and efficient rlhf framework.arXiv preprint arXiv: 2409.19256, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.093876Z"},"links":{"cited_paper":"/paper/2409.19256","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:9ee4d5a8af6af6fa63cd2151a29ca031017675188b7fbe055b3dc65b96ef59b7","observation_id":"f28761a3-3781-4ea6-ba56-de81838ac795","resolution":{"observed_at":"2026-08-07T05:03:28.093876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-07T05:03:27.977837Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.977837Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:9a6c0ba0fcccdad76063e361f152ca801859a27a6a78cf92c77089df2a6d32c4","observation_id":"d72ebdd1-a06d-45cf-ae99-5f5e48a5f708","resolution":{"observed_at":"2026-08-07T05:03:27.977837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-07T05:03:28.325951Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters.arXiv preprint arXiv:2408.03314, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.325951Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:1aa7af410504d63778e49ea0b00c7302182791902831c60acc102b3a8ab9cb24","observation_id":"3773da43-37af-48b7-9350-02da630331d1","resolution":{"observed_at":"2026-08-07T05:03:28.325951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05520","last_updated":"2026-06-21T17:23:43Z","snapshot_observed_at":"2026-08-07T16:07:46.182926Z","submitted_at":"2025-04-07T21:31:31Z","title":"Efficient Reinforcement Finetuning via Adaptive Curriculum Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05520","snapshot_observed_at":"2026-08-07T05:03:28.240528Z","title":"Efficient reinforcement finetuning via adaptive curriculum learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.240528Z"},"links":{"cited_paper":"/paper/2504.05520","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:56536e98894e37d337fc5871f46d77cb723fe6380030d2079bf4c5914b7719c3","observation_id":"207ae8f2-58cf-4814-a505-d16add4c7125","resolution":{"observed_at":"2026-08-07T05:03:28.240528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T05:03:28.528670Z","title":"A minimax- imalist approach to reinforcement learning from human feedback.arXiv:2401.04056, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.528670Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b8bd088d8e09be2a2b0392ec1dda3b0e95e7dce5c2a86afb005803fbdf212f5c","observation_id":"d722aab7-75a3-4e2c-b6c7-a7e5fb01397f","resolution":{"observed_at":"2026-08-07T05:03:28.528670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02674","last_updated":"2025-02-25T16:59:11Z","snapshot_observed_at":"2026-08-08T15:10:21.294174Z","submitted_at":"2024-12-03T18:47:26Z","title":"Mind the Gap: Examining the Self-Improvement Capabilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02674","snapshot_observed_at":"2026-08-07T05:03:28.400160Z","title":"Mind the gap: Examining the self-improvement capabilities of large language models.arXiv preprint arXiv:2412.02674, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.400160Z"},"links":{"cited_paper":"/paper/2412.02674","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:cdbca5925411f8d58507de7e01b76b2fd2739f402e602989a62441b160a81afa","observation_id":"b760d7ee-a2d3-4a3e-a999-b4747dad6391","resolution":{"observed_at":"2026-08-07T05:03:28.400160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:28.718332Z","title":"Preference Fine-Tuning of LLMs Should Leverage Suboptimal, On-Policy Data, ICML 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.718332Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:2a6217a4d49e9941f1ff9ae112cc3698e247d3e1a55d26b006c3b3cee417e4f6","observation_id":"41efc73e-f3a3-4f0f-a89c-97b4007aa361","resolution":{"observed_at":"2026-08-07T05:03:28.718332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:28.616812Z","title":"All roads lead to likelihood: The value of reinforcement learning in fine-tuning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.616812Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:52747cea61decf6e94d8ad407720b8d240b618b8d988062736ea7533b2a7f5c9","observation_id":"014f4051-8c67-462c-929d-4f6ef5cb1548","resolution":{"observed_at":"2026-08-07T05:03:28.616812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:28.890910Z","title":"Open Thoughts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.890910Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:94c3b9a8d246fca5ad41e2f72eca1bf08a6ba9bbe454732609fb328c2b1786e8","observation_id":"741f74ff-94a1-47c6-a190-cdf584061006","resolution":{"observed_at":"2026-08-07T05:03:28.890910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-07T05:03:28.800270Z","title":"Kimi k1.5: Scaling reinforcement learning with llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.800270Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:112584df0705121380c44db030ca79f21fa9aa5e8d2048e1a16a23ddf2c6ad12","observation_id":"878ef22e-f7fb-4336-9912-49ecb9b789eb","resolution":{"observed_at":"2026-08-07T05:03:28.800270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-07T05:03:29.161726Z","title":"Self-consistency improves chain of thought reasoning in language models.arXiv preprint arXiv:2203.11171, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.161726Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6e8ea3993c743d7db33d7e118a9d608d5d58194f64c4caca2254683a41fff4aa","observation_id":"f835cd85-0c80-4003-b734-4115945c1f75","resolution":{"observed_at":"2026-08-07T05:03:29.161726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01939","last_updated":"2025-11-13T10:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T17:54:39Z","title":"Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective Reinforcement Learning for LLM Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01939","snapshot_observed_at":"2026-08-07T05:03:29.029441Z","title":"Beyond the 80/20 rule: High-entropy minority tokens drive effective reinforcement learning for llm reasoning.arXiv preprint arXiv:2506.01939, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.029441Z"},"links":{"cited_paper":"/paper/2506.01939","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:957c4f8b9704c93db7f810c51095746a77fa3232a031b6678be4ebdf758264c1","observation_id":"86ac5cef-66ee-4c4d-9405-8c67ec8399ff","resolution":{"observed_at":"2026-08-07T05:03:29.029441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14768","last_updated":"2025-02-20T17:49:26Z","snapshot_observed_at":"2026-08-04T12:32:53.090165Z","submitted_at":"2025-02-20T17:49:26Z","title":"Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14768","snapshot_observed_at":"2026-08-07T05:03:29.367441Z","title":"Logic-rl: Unleashing llm reasoning with rule-based reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.367441Z"},"links":{"cited_paper":"/paper/2502.14768","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:df048ff8608c2bedbd7b334ef90bc1e8f5ccac5cccad88909ba368273a383ed9","observation_id":"f0eaa6fe-7121-44d7-a84b-6ce3418d5c79","resolution":{"observed_at":"2026-08-07T05:03:29.367441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20571","last_updated":"2025-10-24T10:02:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-29T09:24:30Z","title":"Reinforcement Learning for Reasoning in Large Language Models with One Training Example","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20571","snapshot_observed_at":"2026-08-07T05:03:29.284245Z","title":"Reinforcement learning for reasoning in large language models with one training example.arXiv preprint arXiv:2504.20571, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.284245Z"},"links":{"cited_paper":"/paper/2504.20571","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c7595ea1d2849ebd01eb234a36041dc21e56ba34dc92ff8f5127d79a9bac9eb0","observation_id":"da1e103d-0c2b-46f9-9ec7-68d171daa5b5","resolution":{"observed_at":"2026-08-07T05:03:29.284245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-07T05:03:29.615178Z","title":"Tree of thoughts: Deliberate problem solving with large language models.arXiv preprint arXiv:2305.10601, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.615178Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:23b0761167f31418e75508910e17eac7e37f8b7e2ed638b238d9054ce6b34de9","observation_id":"9f9f2196-f3c0-4924-9bb5-06e05a112b7d","resolution":{"observed_at":"2026-08-07T05:03:29.615178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T05:03:29.500826Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.500826Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:e9f7ce9190de4ec63323162090578e5918b3c6376ef9515f58f6e45a616d51db","observation_id":"968c06be-1c7f-4e33-a8d9-a2e465a1f2d2","resolution":{"observed_at":"2026-08-07T05:03:29.500826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-07T05:03:29.861106Z","title":"Dapo: An open-source llm reinforcement learning system at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.861106Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ef5704b63e46d6cb316c526aafc29b8d0b4b26294814ea4908810131a1039083","observation_id":"8b61a26d-890a-4211-83ab-ee5887694417","resolution":{"observed_at":"2026-08-07T05:03:29.861106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03373","last_updated":"2025-02-05T17:13:32Z","snapshot_observed_at":"2026-07-06T20:31:41.231839Z","submitted_at":"2025-02-05T17:13:32Z","title":"Demystifying Long Chain-of-Thought Reasoning in LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03373","snapshot_observed_at":"2026-08-07T05:03:29.742448Z","title":"Demystifying long chain- of-thought reasoning in llms, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.742448Z"},"links":{"cited_paper":"/paper/2502.03373","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:60f452371c2b68c2ef57da8914e1fa2ce76dacbf8d26b1e746cadac79b47a811","observation_id":"fbe2ba65-17b0-4fc9-a82c-421acd9a1363","resolution":{"observed_at":"2026-08-07T05:03:29.742448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13837","last_updated":"2025-11-24T06:11:04Z","snapshot_observed_at":"2026-07-06T21:11:34.701779Z","submitted_at":"2025-04-18T17:59:56Z","title":"Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13837","snapshot_observed_at":"2026-08-07T05:03:30.047432Z","title":"Does reinforcement learning really incentivize reasoning capacity in llms beyond the base model?arXiv preprint arXiv:2504.13837, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.047432Z"},"links":{"cited_paper":"/paper/2504.13837","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0910d51cd7838dd4e602495d48a5af9a7b383d6f3184d69cf393b0190ab7d513","observation_id":"26d30ab5-fa15-4fc6-bc30-355c07bb69e5","resolution":{"observed_at":"2026-08-07T05:03:30.047432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-07T05:03:29.931120Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:29.931120Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8cbaaa8f7a7fb5ac9d54c67db2c86d394ac6a048a0d681046be2520986b4f08b","observation_id":"233747cc-2482-4e80-a50b-534029d8f11f","resolution":{"observed_at":"2026-08-07T05:03:29.931120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:30.153724Z","title":"Star: Bootstrapping reasoning with reasoning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.153724Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:7bc9a1bb09e87bc0d6f67128a3d7469116a1501bf1f358759395ac18716d299e","observation_id":"5f7f6153-5475-49de-8a4c-b66f7025612a","resolution":{"observed_at":"2026-08-07T05:03:30.153724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19590","last_updated":"2026-05-16T23:13:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T07:01:06Z","title":"Learning to Reason without External Rewards","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19590","snapshot_observed_at":"2026-08-07T05:03:30.482279Z","title":"reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.482279Z"},"links":{"cited_paper":"/paper/2505.19590","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:969f55fe372443dc947501d852cac2f7263dbf5e6552577d2b7e4959cac780a3","observation_id":"5d7413e4-ec3c-41e5-866f-878829bce260","resolution":{"observed_at":"2026-08-07T05:03:30.482279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18892","last_updated":"2025-08-06T08:42:32Z","snapshot_observed_at":"2026-07-06T20:57:57.039376Z","submitted_at":"2025-03-24T17:06:10Z","title":"SimpleRL-Zoo: Investigating and Taming Zero Reinforcement Learning for Open Base Models in the Wild","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18892","snapshot_observed_at":"2026-08-07T05:03:30.353983Z","title":"Simplerl- zoo: Investigating and taming zero reinforcement learning for open base models in the wild, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.353983Z"},"links":{"cited_paper":"/paper/2503.18892","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c328672bb1fd702b25d96dcc2bd99343ce1997cc1d0734eca1210b1183ad1473","observation_id":"6d5d42ea-cccc-42f2-9151-fa579a2a658d","resolution":{"observed_at":"2026-08-07T05:03:30.353983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:34.879322Z","title":"Looking at the other numbers: 77 - 70 = 7 97 - 73 = 24 (interesting, we already have","venue":null,"work_id":"c5c71ba2-e250-4844-ab65-1c5e816ec2cf","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.298133Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:967545e5458b204ccc98cf2ceb6dae71b3022bd72e0eaefc6d4fe7ab3efad520","observation_id":"d8b24c0e-a7a5-4ddb-bdfa-0e4246605f7a","resolution":{"observed_at":"2026-08-07T05:03:34.993578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:40.613658Z","title":null,"venue":null,"work_id":"e750b564-1296-4f0f-9f64-bfd2a7c64551","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.603388Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ab1f3959c7a618f18654d5024d5ddfc11609e79497e1fa9426fb3f641fb3ba87","observation_id":"73793d47-d65d-4c6b-be67-7ad5aa220217","resolution":{"observed_at":"2026-08-07T05:03:40.735256Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:40.397426Z","title":"We need to get from 37 to 466, which means we need to multiply by 12.5","venue":null,"work_id":"c8cbe06c-3eb1-477f-9a71-0a28346f9cde","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.705279Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0ebf846ecd7f3585964ff2f6372054fb15f1df7222f88e1ef23147d5cd713298","observation_id":"16ec9fdc-ddb2-4d41-8eec-2bc04cbf672b","resolution":{"observed_at":"2026-08-07T05:03:40.511892Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:40.197661Z","title":null,"venue":null,"work_id":"044afcce-fd62-4787-a2c3-923afa2a7874","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.826305Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6f93b1537dd22f94900c5f9aa67bb4ef40c4d32200ac4a3fe2e394402f53a2be","observation_id":"cba0c388-9ba8-48ee-91d6-0e00a7c42aaa","resolution":{"observed_at":"2026-08-07T05:03:40.298433Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.984330Z","title":null,"venue":null,"work_id":"1e3ad36e-1c25-462c-866f-446bf56b60b2","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:30.947729Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0e200bff26d13e050e04c45de5605197d8aebd99fa74086ba71bb8bff09fd5d4","observation_id":"7703ae3e-ae22-45dc-a9ec-624e83181129","resolution":{"observed_at":"2026-08-07T05:03:40.090080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.775175Z","title":null,"venue":null,"work_id":"b5fc1195-7d18-4a95-99b1-334d84174940","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.064851Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:c1146db3b7fc45bfb8d82f03eb625d231fbff3c06caca903f533cb7c900801cc","observation_id":"38c15b0c-bec0-4193-848a-65acd990faf9","resolution":{"observed_at":"2026-08-07T05:03:39.898527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.534070Z","title":null,"venue":null,"work_id":"f364c4e3-ae85-4dad-b519-a5e8d30e2c1d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.157389Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8eb0f5e762e54ad233292de6a953065f4bd7947715a61e9bbc1c2e75608f958e","observation_id":"2b8878db-da0e-463d-b3f2-5872b395b83c","resolution":{"observed_at":"2026-08-07T05:03:39.646657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.349533Z","title":null,"venue":null,"work_id":"ecf5ad2a-36fb-48b9-b63d-fbfc93902027","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.247123Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b13abc07f83798e09002f108a55f5273486ce849c746442055d2cbc70b2e3293","observation_id":"48455646-a978-45c3-8a4c-22f364a55508","resolution":{"observed_at":"2026-08-07T05:03:39.438320Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:39.100239Z","title":null,"venue":null,"work_id":"19ab7408-3085-452e-971c-87f3dbee3a12","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.382722Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6aaca727f344305a66c5fcdc7aadc607bddc42309695c5b3ab9a85cb47f28a47","observation_id":"bcb27548-26d4-4336-8b9f-2c7770a86ee7","resolution":{"observed_at":"2026-08-07T05:03:39.216261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.928827Z","title":null,"venue":null,"work_id":"4210c466-0b0f-499d-bd69-e62dc21bd59d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.517583Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:66a6d0a5dbfc95cad2a67dc33165b2f6a220fbdfdff3073b52faaf11375daf2f","observation_id":"a42f1119-c124-4ced-840f-64137e979db0","resolution":{"observed_at":"2026-08-07T05:03:39.009793Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.782657Z","title":null,"venue":null,"work_id":"f73104f7-4a95-4442-9598-9fa14f2bb2ee","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.600499Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4a51af17febc027740ef62c03582c8576edddddcd9310ed1592a13fedc551a4b","observation_id":"66d47b82-d388-4183-a294-7b9d7472290d","resolution":{"observed_at":"2026-08-07T05:03:38.877821Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.524859Z","title":null,"venue":null,"work_id":"7e3240ae-113c-41cb-8458-f07a8297360d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.690026Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:110353ef5ca4dafc3bb6483a1c9e90d2da5054884d1b88f22b541c2147640111","observation_id":"476391ed-9599-46d5-ac75-e69fa5892a14","resolution":{"observed_at":"2026-08-07T05:03:38.657484Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.295934Z","title":null,"venue":null,"work_id":"8023548e-c2c8-47e6-9a27-8f333e748a0d","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.769004Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:28db9291adb79e378521838a5a4799573958e325b3c49f9fb08b8b05eff9cf99","observation_id":"7f1d463a-e987-489c-99e0-3e57a75edd6e","resolution":{"observed_at":"2026-08-07T05:03:38.408750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:38.045224Z","title":null,"venue":null,"work_id":"b1ea87ea-077c-43e3-b517-7dda2b3052c7","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:31.928589Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:6b6e68ef83f45d38449291aa5c68d2cbcf9ab257177d18cb9861220064e28863","observation_id":"75ba2295-f46d-4876-a35b-e71b4b53bfff","resolution":{"observed_at":"2026-08-07T05:03:38.133653Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.838165Z","title":null,"venue":null,"work_id":"bb5b9a53-57e7-4554-87f5-06d7a42d7e1f","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.068744Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:98a011d20351ac6a73b5b35ed5420a5ec297bd48170bfc3bc59aca402f243391","observation_id":"66dfd81e-85ea-4ea7-bdde-1fa303f6a108","resolution":{"observed_at":"2026-08-07T05:03:37.931265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.623360Z","title":null,"venue":null,"work_id":"af099457-1e81-4dea-8574-5acf8490a235","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.154019Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:f9cef6bfb54a37c5f609f2e635aa9959bb44bb95f5cdd6bf6fee80923c1fd360","observation_id":"b2e2a2a8-3ad0-47ab-9d10-8fe797d320e0","resolution":{"observed_at":"2026-08-07T05:03:37.716974Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.388576Z","title":null,"venue":null,"work_id":"93f7cb7e-a6fa-478d-863f-ac63c9e66bdf","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.248190Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:d5901d0be84e2f7a960fb36de5b7dbbe1fea033ba2d8631337fc606ea4de4f38","observation_id":"884f3572-8433-4f42-9e4b-22f75dd0c333","resolution":{"observed_at":"2026-08-07T05:03:37.520483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:37.201597Z","title":null,"venue":null,"work_id":"5502ebe3-a6ec-4383-9310-10344ddc43ed","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.343942Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:ce2926f943d8f09977a3920b5f87271d26803995035241ec4c40a47b592132bb","observation_id":"437b83b2-677a-4490-8b68-89b6d5c1cd3c","resolution":{"observed_at":"2026-08-07T05:03:37.291156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.955018Z","title":null,"venue":null,"work_id":"92cfbe98-2ceb-4429-9abb-c55a1d769385","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.446315Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4c667a657479f94ac6af08c6aa22019aa9ff615abec2dcd19d03bc92929e0f23","observation_id":"269eedb9-3091-40f7-8272-7aefe649550e","resolution":{"observed_at":"2026-08-07T05:03:37.088649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.711796Z","title":"31.5 (not helpful)","venue":null,"work_id":"2e686b89-89d0-4195-9c38-12fe853a0907","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.586951Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:cef28e94156410310b0faa61d5b0371b3794d649a7be30401f7cda245eb08e0f","observation_id":"3c5a907d-1706-4adc-88f4-31f4dc9dbfbd","resolution":{"observed_at":"2026-08-07T05:03:36.816490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.446167Z","title":null,"venue":null,"work_id":"3a7de96c-34a0-4a10-a9ff-7c96d7f090c7","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.661655Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:8b5c86f51c103518ab310211e0dd3b3a52516fbb3752ea55fd9249d62fb5994c","observation_id":"7db092d6-5cdf-4905-bf33-b562e09ffb1b","resolution":{"observed_at":"2026-08-07T05:03:36.569151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.219769Z","title":null,"venue":null,"work_id":"7eef341d-0efe-4681-8a97-7dff45ca13fe","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.768424Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:0da2878f78e6000b99241f814dec44e6c2d7b206c13af4acaff0421ed3b1021f","observation_id":"cd6f2c5d-3087-473a-85c4-ca16269bc216","resolution":{"observed_at":"2026-08-07T05:03:36.358782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:36.024239Z","title":null,"venue":null,"work_id":"688a295d-f2c4-41a9-b21f-9c8f39626b31","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:32.882107Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:4e974c9987ef6cb6142c58a35803ccc29fbd8333943b9f5d025f5892b544c7f5","observation_id":"8fa66cf5-8f1c-40b3-b0a2-9e5cf583b650","resolution":{"observed_at":"2026-08-07T05:03:36.118343Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:35.711588Z","title":null,"venue":null,"work_id":"7d9845e0-b422-4d82-b48e-ed88764fbc25","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.007560Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:829f220375bee63d75e28bbfdec26e7b7725313dfeac6d255c464968da02e903","observation_id":"2efbcaa7-2bed-4693-941a-5eb70b13dbd1","resolution":{"observed_at":"2026-08-07T05:03:35.933890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:35.450239Z","title":"Hmm, let me think about how to approach this","venue":null,"work_id":"76051158-331e-42e1-b772-776e9dff6410","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.139220Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:5c7f92c412e4c1f2ed0e26bbd4c9cbf0bd275168a51d9c93be374e578ab6d7b7","observation_id":"415a2322-a148-4db3-849e-c71a98eef83b","resolution":{"observed_at":"2026-08-07T05:03:35.609076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:34.653935Z","title":null,"venue":null,"work_id":"65b63f16-6d48-4eee-8c7a-6ac7248db84b","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.393958Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:f830e8066861029f1779540da8b87aa4ec42ccf7ebf75f1a7ab10da027c3b0ec","observation_id":"9759744a-aa27-460a-9737-6bad422b14a8","resolution":{"observed_at":"2026-08-07T05:03:34.743229Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:03:35.165723Z","title":"Again, multiply 347 by 5 and add two zeros","venue":null,"work_id":"85d0c7f3-0b15-4e81-a142-deb23741ad6a","year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":500,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:33.212215Z"},"links":{"citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:89a7e60c7c9c9911f4953ca195228f5988ce132c08f9814284479d5acbe49c43","observation_id":"e8a353ca-341f-4290-925d-faf4647054df","resolution":{"observed_at":"2026-08-07T05:03:35.287512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:03:25.469591Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:25.469591Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:69bb4d2c926240e9bf96d214e150b020d597c3d7cbf0855e2003ad07981528b4","observation_id":"7ca58a45-cbde-464b-9c44-32b754e36ef5","resolution":{"observed_at":"2026-08-07T05:03:25.469591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs"},"reference_resolution":{"displayed":92,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":85,"verified_exact":2,"verified_fuzzy":5},"total_outbound_references":92},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 92 of 92 outbound references and 11 inbound Pith citation observations for arXiv:2506.09026."}