{"as_of":"2026-08-08T20:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40c503d425fdfddfbab7f5970d4a0619861a892944b4ba064cc922740e31d11a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:17:44.275296Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T20:38:56.081466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2503.17352","last_updated":"2025-11-11T08:13:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-21T17:52:43Z","title":"OpenVLThinker: Complex Vision-Language Reasoning via Iterative SFT-RL Cycles","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-19T06:59:03.112252Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2503.17352"},"observation_digest":"sha256:cde08505f593465380c2e414444200a924852233f75cd76c3be1f5017b068f1c","observation_id":"8bbf0e62-8788-46db-b714-22f2cd90189d","resolution":{"observed_at":"2026-05-19T06:59:03.238636Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2504.01990","last_updated":"2025-08-02T12:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T18:00:29Z","title":"Advances and Challenges in Foundation Agents: From Brain-Inspired Intelligence to Evolutionary, Collaborative, and Safe Systems","version":2},"reference_index":211,"source":"pdf_text","source_observed_at":"2026-05-22T21:39:49.832151Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2504.01990"},"observation_digest":"sha256:4758ca2b68f9a9e7ed190560a2ef800ebae75ce4b6634a7ace9b1cc261aba911","observation_id":"58108822-4319-4b0e-9fc6-2ea880285d84","resolution":{"observed_at":"2026-05-22T21:42:10.540276Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2505.15134","last_updated":"2025-05-21T05:39:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T05:39:11Z","title":"The Unreasonable Effectiveness of Entropy Minimization in LLM Reasoning","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-18T15:58:33.219451Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.15134"},"observation_digest":"sha256:ec5d4c548674ddc617c1908fd912d0b92a56932335cb503b729dae3065b3c931","observation_id":"d61edaaa-bdcf-42ae-ab77-16a2fcdc166a","resolution":{"observed_at":"2026-05-18T15:58:33.485438Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T14:17:44.275296Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19475","last_updated":"2025-05-28T11:04:19Z","snapshot_observed_at":"2026-08-08T15:11:51.265629Z","submitted_at":"2025-05-26T03:54:47Z","title":"Continuous Self-Improvement of Large Language Models by Test-time Training with Verifier-Driven Sample Selection","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:44.275296Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.19475"},"observation_digest":"sha256:63a87c5ebe48e266ee649ba385d879e1be0b765863030ee9dc75e8e7276d9fbf","observation_id":"38e18a3b-642c-459f-8caa-ccc9876c8e26","resolution":{"observed_at":"2026-08-07T14:17:44.275296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T14:14:22.796446Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.19634","last_updated":"2025-09-12T01:41:20Z","snapshot_observed_at":"2026-08-08T14:46:12.061876Z","submitted_at":"2025-05-26T07:51:30Z","title":"Faster and Better LLMs via Latency-Aware Test-Time Scaling","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:14:22.796446Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.19634"},"observation_digest":"sha256:a03ac7aecaf29f920eed76044e96b56914af4cb21991b8ce4b7a34155bc96803","observation_id":"00262278-648d-401e-83b7-43a01aac0f27","resolution":{"observed_at":"2026-08-07T14:14:22.796446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T13:58:36.660912Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20522","last_updated":"2025-06-07T22:18:32Z","snapshot_observed_at":"2026-08-07T13:50:26.001759Z","submitted_at":"2025-05-26T20:58:45Z","title":"Scaling over Scaling: Exploring Test-Time Scaling Plateau in Large Reasoning Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:58:36.660912Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.20522"},"observation_digest":"sha256:83c9f7f570d9fc82b657399276040eb172fcc5b3d653a6fa1cade82ca82880da","observation_id":"0ca12fc2-9a90-4756-9d71-03f3a2ca862b","resolution":{"observed_at":"2026-08-07T13:58:36.660912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2505.23912","last_updated":"2026-05-13T21:21:09Z","snapshot_observed_at":"2026-08-02T15:55:45.353476Z","submitted_at":"2025-05-29T18:05:20Z","title":"LoVeC: Reinforcement Learning for Better Verbalized Confidence in Long-Form Generations","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-19T12:43:51.019983Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2505.23912"},"observation_digest":"sha256:77c3ca41ee9e3731ecd770bf457104e3de2be074e25b2e979c0cb94687e90667","observation_id":"4fd36060-3c10-44c7-b923-e4aacd158829","resolution":{"observed_at":"2026-05-19T12:47:17.990957Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T12:02:45.177987Z","title":"Scaling test-time compute without verification or rl is suboptimal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00845","last_updated":"2025-08-17T12:17:48Z","snapshot_observed_at":"2026-08-07T16:09:18.251031Z","submitted_at":"2025-06-01T05:39:56Z","title":"Generalizable LLM Learning of Graph Synthetic Data with Post-training Alignment","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:02:45.177987Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.00845"},"observation_digest":"sha256:192b97f4bc9be75a2f5b93419a17dcf33ad3695764bd4934fb6b97dd05e7b8f4","observation_id":"55ac6afc-efc0-4230-bf21-ea854c17561c","resolution":{"observed_at":"2026-08-07T12:02:45.177987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T10:42:41.015386Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04611","last_updated":"2025-06-05T04:02:17Z","snapshot_observed_at":"2026-08-07T13:54:09.003484Z","submitted_at":"2025-06-05T04:02:17Z","title":"Revisiting Test-Time Scaling: A Survey and a Diversity-Aware Method for Efficient Reasoning","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T10:42:41.015386Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.04611"},"observation_digest":"sha256:0f69685ea538332a175cc70a7f4be643a41d5d0fc784dc4d4ebc7bcf2b9f4360","observation_id":"c5cb6b72-cbe8-4b35-8f4d-b19e3acc3ea8","resolution":{"observed_at":"2026-08-07T10:42:41.015386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T10:35:37.965006Z","title":"Setlur, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.05295","last_updated":"2025-06-12T16:25:06Z","snapshot_observed_at":"2026-08-08T15:08:35.134546Z","submitted_at":"2025-06-05T17:48:19Z","title":"Sample Complexity and Representation Ability of Test-time Scaling Paradigms","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T10:35:37.965006Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.05295"},"observation_digest":"sha256:407d188db1255a210fcd7cbe8034318efcd60532b9852b788c0cf8653cb4439c","observation_id":"e0e4fd3c-792e-4adf-918e-215295894e38","resolution":{"observed_at":"2026-08-07T10:35:37.965006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:27:50.219788Z","title":"Scaling test- time compute without verification or rl is suboptimal.ArXiv, abs/2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07976","last_updated":"2025-06-10T12:50:18Z","snapshot_observed_at":"2026-08-07T20:50:35.036523Z","submitted_at":"2025-06-09T17:50:02Z","title":"Thinking vs. Doing: Agents that Reason by Scaling Test-Time Interaction","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:27:50.219788Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.07976"},"observation_digest":"sha256:0c2481fda915c7e95b2e5226a150801ad671907d6b0989f55606947862324ea3","observation_id":"f20f4c7f-9d7b-48aa-9f8d-bad1bab99af3","resolution":{"observed_at":"2026-08-07T05:27:50.219788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-07T05:03:27.653994Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:27.653994Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:452517ae4d9eb5b632bbf9a6b20a6e063b8b06f4d59aba6b4a570fcae300cb22","observation_id":"d155d0d9-b405-46c5-9231-8f57d771e0eb","resolution":{"observed_at":"2026-08-07T05:03:27.653994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-06T23:36:10.024727Z","title":"Scaling test- time compute without verification or rl is suboptimal,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.17601","last_updated":"2025-06-21T05:39:04Z","snapshot_observed_at":"2026-08-08T15:11:41.417296Z","submitted_at":"2025-06-21T05:39:04Z","title":"Risk-Guided Diffusion: Toward Deploying Robot Foundation Models in Space, Where Failure Is Not An Option","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T23:36:10.024727Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2506.17601"},"observation_digest":"sha256:b19e353404d6bb13b701d3313da5a2a9e6c3cf588d7ab2cfa14d96974399bbef","observation_id":"c3185151-7874-4f06-bdd5-076ba5a0224f","resolution":{"observed_at":"2026-08-06T23:36:10.024727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-06T18:11:18.663876Z","title":", author Rajaraman, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.09075","last_updated":"2025-07-11T23:35:54Z","snapshot_observed_at":"2026-08-08T12:25:01.827357Z","submitted_at":"2025-07-11T23:35:54Z","title":"OpenCodeReasoning-II: A Simple Test Time Scaling Approach via Self-Critique","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T18:11:18.663876Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2507.09075"},"observation_digest":"sha256:77de4a00b4cbcb0fba67bf86a0584d0dec2f4d055ddafb2be4c17bd50ea1b55a","observation_id":"db2f22e1-3716-4ea5-b409-8dafbf119d55","resolution":{"observed_at":"2026-08-06T18:11:18.663876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-05T13:52:50.698310Z","title":"Setlur, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.00271","last_updated":"2026-06-17T20:45:44Z","snapshot_observed_at":"2026-08-08T09:36:37.528608Z","submitted_at":"2025-08-29T22:56:32Z","title":"Learn from What We HAVE: History-Aware VErifier that Reasons about Past Interactions Online","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T13:52:50.698310Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2509.00271"},"observation_digest":"sha256:aaed26c0e152b5dc61399eb0579fe26b38bc3a8b722776d7c4306786a04b59bc","observation_id":"cd3a6297-62fc-40ba-8849-979f98675793","resolution":{"observed_at":"2026-08-05T13:52:50.698310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-05T10:31:37.862981Z","title":"Scaling test-time compute without verification or rl is suboptimal","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.04027","last_updated":"2026-06-09T07:28:31Z","snapshot_observed_at":"2026-08-05T10:31:32.575543Z","submitted_at":"2025-09-04T09:02:16Z","title":"Why Does Reasoning Length Converge? Unveiling the Underfitting-Overfitting Trade-off in Chain-of-Thought","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T10:31:37.862981Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2509.04027"},"observation_digest":"sha256:97898055cc91b3f9ec747316746adf1b38720e9970cb6333ae44839b7f8f5434","observation_id":"c3121a39-00b2-46a5-a1ab-654f921f914f","resolution":{"observed_at":"2026-08-05T10:31:37.862981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-04T21:32:59.185386Z","title":"Scaling test-time compute without verification or rl is suboptimal.arXiv preprint arXiv:2502.12118, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.07953","last_updated":"2025-09-09T17:41:29Z","snapshot_observed_at":"2026-08-08T15:11:35.635416Z","submitted_at":"2025-09-09T17:41:29Z","title":"RaC: Robot Learning for Long-Horizon Tasks by Scaling Recovery and Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T21:32:59.185386Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2509.07953"},"observation_digest":"sha256:d34f7e4d7a0da78ca102b0742a0fba5ad83c09d8ab3e8a98fb5d391e18f4b09f","observation_id":"7a0040a0-e9bb-426a-964a-23a9867f6fc7","resolution":{"observed_at":"2026-08-04T21:32:59.185386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-03T21:03:18.958441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.21734","last_updated":"2026-05-23T06:59:38Z","snapshot_observed_at":"2026-08-08T15:37:54.200994Z","submitted_at":"2025-11-21T09:55:34Z","title":"Asking LLMs to Verify First is Almost Free Lunch","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T21:03:18.958441Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2511.21734"},"observation_digest":"sha256:d94e89a94f62b64d4d794cfe7b928d7804757b8e70ff9e090c3be25450bba94b","observation_id":"3cd3c06e-92ef-46b1-b172-6c3976ea4406","resolution":{"observed_at":"2026-08-03T21:03:18.958441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2603.04333","last_updated":"2026-05-08T20:08:31Z","snapshot_observed_at":"2026-07-31T16:31:42.095039Z","submitted_at":"2026-03-04T17:51:30Z","title":"What Does Flow Matching Bring To TD Learning?","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-15T16:32:29.432272Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2603.04333"},"observation_digest":"sha256:dff4e402dd4e94412874573bc23e4462dba7f8edfdf00c48945bcd02f5817ef5","observation_id":"93315f33-d916-44be-ae74-e752e30de6b1","resolution":{"observed_at":"2026-05-15T16:36:17.910581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2604.21268","last_updated":"2026-04-23T04:23:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-23T04:23:31Z","title":"Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-09T23:05:05.251150Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2604.21268"},"observation_digest":"sha256:32ec65b896fae7a292c916192334c412ad75f1c74d5be9401d357443bf7389c6","observation_id":"7eaa64f9-baa4-4f34-8c4d-6dd271c40469","resolution":{"observed_at":"2026-05-11T14:16:05.777615Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2605.15513","last_updated":"2026-05-15T01:16:12Z","snapshot_observed_at":"2026-08-01T17:14:08.866403Z","submitted_at":"2026-05-15T01:16:12Z","title":"CAPS: Cascaded Adaptive Pairwise Selection for Efficient Parallel Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-19T15:39:56.255871Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2605.15513"},"observation_digest":"sha256:957a330d0ca4942fdf267cdced091ab38b163b0107b77f80ef969ae6f04fbc94","observation_id":"deee3ea0-b457-41b0-a510-eddef6dc0fa7","resolution":{"observed_at":"2026-05-19T15:42:38.364806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2605.30070","last_updated":"2026-05-28T15:17:19Z","snapshot_observed_at":"2026-07-06T23:39:24.682426Z","submitted_at":"2026-05-28T15:17:19Z","title":"A Predictive Law for On-Policy Self-Distillation From World Feedback","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-29T09:08:16.307499Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2605.30070"},"observation_digest":"sha256:b1b07e98d8faa24846ea8db9e1c07f7800aaf658901224ea54797ef0d29ab6df","observation_id":"0c548352-46e2-484a-bb5d-e726d873864a","resolution":{"observed_at":"2026-06-29T09:13:16.210460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2606.01075","last_updated":"2026-06-02T05:50:15Z","snapshot_observed_at":"2026-08-08T11:14:54.052517Z","submitted_at":"2026-05-31T07:43:19Z","title":"On the Generalization Gap in Self-Evolving Language Model Reasoning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T17:18:37.671369Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2606.01075"},"observation_digest":"sha256:c6dc726fb38d4ca3d7dd5f0849ac9ab09254d9dabdb3439f105b9e6ee0847cb4","observation_id":"959bee1d-0987-4be4-adfc-c3212bae2d98","resolution":{"observed_at":"2026-06-28T17:22:24.924302Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":"2502.12118","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-03T20:38:56.081466Z","title":"Scalingtest-timecomputewithout verification or rl is suboptimal","venue":null,"work_id":"f01d383c-eb52-4fe5-8e17-9f763cf82d39","year":2025},"citing_paper":{"arxiv_id":"2606.18089","last_updated":"2026-07-05T17:40:26Z","snapshot_observed_at":"2026-07-12T13:34:39.011240Z","submitted_at":"2026-06-16T15:55:28Z","title":"From Reasoning Traces to Reusable Modules: Understanding Compositional Generalization in Language Model Reasoning","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-06-27T01:13:11.483599Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2606.18089"},"observation_digest":"sha256:828c5e128097392dd82c13794e02da90ec78ee10d21c9d9577c39136b5a9cc27","observation_id":"49abea7f-0bf0-4190-a9ec-c0beb200826f","resolution":{"observed_at":"2026-07-03T20:38:56.082787Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-07-13T03:00:51.318412Z","title":"Setlur, N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09438","last_updated":"2026-07-10T14:09:04Z","snapshot_observed_at":"2026-08-06T13:00:09.267598Z","submitted_at":"2026-07-10T14:09:04Z","title":"Test-Time Scaling for Small VLMs on Multilingual Visual MCQ","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-13T03:00:51.318412Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2607.09438"},"observation_digest":"sha256:d07beadc1e3ede09fb01d60967f23075b1eaf5071bd18bdad18a13fd2dbe6d49","observation_id":"ec8e1e04-02ca-48cf-8566-aa37402a0fb1","resolution":{"observed_at":"2026-07-13T03:00:51.318412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12118","snapshot_observed_at":"2026-08-01T17:46:56.344831Z","title":"arXiv preprint arXiv:2502.12118 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17531","last_updated":"2026-07-20T04:09:19Z","snapshot_observed_at":"2026-08-01T17:46:52.974934Z","submitted_at":"2026-07-20T04:09:19Z","title":"Oracle Gap and Signal Fidelity: A Fixed-Pool Diagnostic for Test-Time Collaboration","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T17:46:56.344831Z"},"links":{"cited_paper":"/paper/2502.12118","citing_paper":"/paper/2607.17531"},"observation_digest":"sha256:98424dba2d7fa16332969d60f3e0c4c81989dc2d27c5883188259cd353bf4379","observation_id":"86aa1bbb-a3b7-404f-b30e-bee62b08caac","resolution":{"observed_at":"2026-08-01T17:46:56.344831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.12118/citation-record","integrity":"/paper/2502.12118/integrity","json":"/paper/2502.12118/citation-record.json","paper":"/paper/2502.12118"},"outbound":[],"paper":{"arxiv_id":"2502.12118","last_updated":"2025-02-18T18:54:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T18:11:25.040275Z","submitted_at":"2025-02-17T18:43:24Z","title":"Scaling Test-Time Compute Without Verification or RL is Suboptimal"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2502.12118."}