{"as_of":"2026-08-08T04:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:26c99a72a0e848d2b09631aebfaa4ce8993da267b7a797c00125ff9c19affc27","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T23:34:10.768149Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15388/citation-record","integrity":"/paper/2607.15388/integrity","json":"/paper/2607.15388/citation-record.json","paper":"/paper/2607.15388"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.10508","last_updated":"2026-04-12T07:51:41Z","snapshot_observed_at":"2026-07-06T22:59:09.778842Z","submitted_at":"2026-04-12T07:51:41Z","title":"How Many Tries Does It Take? Iterative Self-Repair in LLM Code Generation Across Model Scales and Benchmarks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.10508","snapshot_observed_at":"2026-08-01T23:34:05.670060Z","title":"How many tries does it take? Iterative self-repair in LLM code generation across model scales and benchmarks.arXiv preprint arXiv:2604.10508, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:05.670060Z"},"links":{"cited_paper":"/paper/2604.10508","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:c6f27f25f7ee4c9db3388affb80d747ce322de713b85153b6235db32d361b83a","observation_id":"946d907e-8464-449c-b318-dbdc1bfefe59","resolution":{"observed_at":"2026-08-01T23:34:05.670060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:05.720372Z","title":"Benchmarks saturate when the model gets smarter than the judge.arXiv preprint arXiv:2601.19532, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:05.720372Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:98697b0be3d4535b03f632cb69a7bf2846612fbf742940404bd44bada2db329e","observation_id":"41556648-636e-46e7-9950-5324951d6638","resolution":{"observed_at":"2026-08-01T23:34:05.720372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:06.070973Z","title":"xverify: Efficient answer verifier for reasoning model evaluations.arXiv preprint arXiv:2504.10481, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.070973Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:4e7787f163f6a879f67604993c8d2dd9f56da0c163fe93f15f8a64faaa8a4f7c","observation_id":"a403b750-4dea-4d47-873b-ac7062439b01","resolution":{"observed_at":"2026-08-01T23:34:06.070973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:06.218181Z","title":"A coefficient of agreement for nominal scales.Educational and Psychological Measurement, 20(1):37–46, 1960","venue":null,"work_id":null,"year":1960},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.218181Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:938f8e223e40c4cee336e063bd76a8d8c31828d9b334ffa5d0edfbed879dfe2b","observation_id":"846e75f2-a91c-47a2-a240-9bde89501526","resolution":{"observed_at":"2026-08-01T23:34:06.218181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-01T23:34:06.309736Z","title":"Tenenbaum, and Igor Mordatch","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.309736Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:f7727244d9bf812febbe9ca2ae668f94b9f7f65114dfdc000fa2e7a61b904eed","observation_id":"f4893f67-e0f0-4aa1-8f5e-89e3ef673b17","resolution":{"observed_at":"2026-08-01T23:34:06.309736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07985","last_updated":"2024-12-24T04:04:30Z","snapshot_observed_at":"2026-08-05T09:35:42.754650Z","submitted_at":"2024-10-10T14:39:33Z","title":"Omni-MATH: A Universal Olympiad Level Mathematic Benchmark For Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07985","snapshot_observed_at":"2026-08-01T23:34:06.382219Z","title":"Omni-math: A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.382219Z"},"links":{"cited_paper":"/paper/2410.07985","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:968d43f0758ddddc3eba13c87089f99b1a20af92b41f6228109ea06c9a3c2b6a","observation_id":"5f3ef200-f229-4067-a7f3-498e6f885606","resolution":{"observed_at":"2026-08-01T23:34:06.382219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-01T23:34:06.435035Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.435035Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:c1738943371e8a6d0d1716a2f0c323937eda53b3d1be77024235007970db27f0","observation_id":"21176412-77ba-4a5c-a2ab-0f877c91a028","resolution":{"observed_at":"2026-08-01T23:34:06.435035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01502","last_updated":"2024-07-01T17:48:14Z","snapshot_observed_at":"2026-08-06T22:15:08.500389Z","submitted_at":"2024-07-01T17:48:14Z","title":"AI Agents That Matter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01502","snapshot_observed_at":"2026-08-01T23:34:06.567758Z","title":"Siegel, Nitya Nadgir, and Arvind Narayanan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.567758Z"},"links":{"cited_paper":"/paper/2407.01502","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:939d1dd789d9d9ee4bb9772c215f71255ee63a7c5f6ead16bc83e39e2db5cf41","observation_id":"30eceb0e-c75e-4f61-917c-707457da1c27","resolution":{"observed_at":"2026-08-01T23:34:06.567758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.08296","last_updated":"2026-04-08T21:31:49Z","snapshot_observed_at":"2026-08-06T14:12:10.843049Z","submitted_at":"2025-12-09T06:52:21Z","title":"Towards a Science of Scaling Agent Systems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.08296","snapshot_observed_at":"2026-08-01T23:34:06.985088Z","title":"Ali Heydari, Yao Yan, Zhihan Zhang, Yuchen Zhuang, Yun Liu, Mark Malhotra, and Paul Pu Liang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.985088Z"},"links":{"cited_paper":"/paper/2512.08296","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:677fb2b4b590579399c4a95491b5823904695fe31c8d01b96f96449b2f25959f","observation_id":"aabdee1f-1d04-43fe-b11a-61957d61f5fd","resolution":{"observed_at":"2026-08-01T23:34:06.985088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:07.101341Z","title":"Richard Landis and Gary G","venue":null,"work_id":null,"year":1977},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.101341Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:50f1becd097c751f74459a2fec6229bb9b818c8396bb7d821e7dcc11b611aa92","observation_id":"42ff4daa-3c5a-46ba-9b67-c49dd8300c2e","resolution":{"observed_at":"2026-08-01T23:34:07.101341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17760","last_updated":"2023-11-02T17:34:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-31T01:09:00Z","title":"CAMEL: Communicative Agents for \"Mind\" Exploration of Large Language Model Society","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17760","snapshot_observed_at":"2026-08-01T23:34:07.165520Z","title":"CAMEL: Communicative agents for mind exploration of large scale language model society.arXiv preprint arXiv:2303.17760, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.165520Z"},"links":{"cited_paper":"/paper/2303.17760","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:af8657bb277fd427447d3cb1a861d68bbdee537fdf3a91115917c627cb89d688","observation_id":"1a7c4be0-789c-49f5-8b13-e97999bf956f","resolution":{"observed_at":"2026-08-01T23:34:07.165520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:07.241798Z","title":"Decomposing LLM self-correction: The accuracy-correction paradox and error depth hypothesis.arXiv preprint arXiv:2601.00828, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.241798Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:4ac1c2708b3bc54629fc6da7a876072f913f58d6564d188951848676fb996c29","observation_id":"341b1928-7631-4c62-bdb3-adb4cdaf3eca","resolution":{"observed_at":"2026-08-01T23:34:07.241798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-06T20:36:41.418114Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-01T23:34:07.318575Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.318575Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:11196254fcb6b307230699b18c4b5e6d1150c9af4f5199211890b1e6be19cea3","observation_id":"70139a04-5810-41de-a13e-81fe8a44fcc1","resolution":{"observed_at":"2026-08-01T23:34:07.318575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-01T23:34:07.388941Z","title":"Self- refine: Iterative refinement with self-feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.388941Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:e1c00cb33765c4781a64d7f1b018ac891c42f47f47eb0655a5e89eccf07c901d","observation_id":"9beaba57-822b-4468-95b9-3594164b9aa8","resolution":{"observed_at":"2026-08-01T23:34:07.388941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:07.475071Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.475071Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:b5927cbbcdba2b6c1bb4472b09cb2273ce5b684a87652278248361cceca381df","observation_id":"6bd452a2-4c47-4f12-b6e6-65ba3ebb23a6","resolution":{"observed_at":"2026-08-01T23:34:07.475071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:07.799710Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.799710Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:8ec21558307e65fe855ac6792411fda0b60602e4b171db792f012531f26c409e","observation_id":"86a8efee-ccfb-4b45-9811-c868114bd03e","resolution":{"observed_at":"2026-08-01T23:34:07.799710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09721","last_updated":"2023-11-16T09:55:07Z","snapshot_observed_at":"2026-07-06T16:48:29.239105Z","submitted_at":"2023-11-16T09:55:07Z","title":"On Evaluating the Integration of Reasoning and Action in LLM Agents with Database Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09721","snapshot_observed_at":"2026-08-01T23:34:07.962606Z","title":"On evaluating the integration of reasoning and action in LLM agents with database question answering.arXiv preprint arXiv:2311.09721, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.962606Z"},"links":{"cited_paper":"/paper/2311.09721","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:8d15b2e8280d9176ea055206357a2eb31c3cc2264326c3f708a332013be2e84e","observation_id":"067ab163-1a96-4334-9b77-ddb1c0f14e19","resolution":{"observed_at":"2026-08-01T23:34:07.962606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:08.166111Z","title":"gpt-oss-120b model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.166111Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:e56090a1f61b1acbb1c32807fb1caefbb07982e8ff2180c17a1009664a8dca91","observation_id":"3529d686-f8c3-4ff9-b29c-b384223e5562","resolution":{"observed_at":"2026-08-01T23:34:08.166111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:08.305502Z","title":"Introducing gpt-oss, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.305502Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:b43504d0fef73e20fe6819c012d030516203451e360ac0e91e09e79940ee1d35","observation_id":"84e8b31b-0595-4817-a0af-95f4cc49235e","resolution":{"observed_at":"2026-08-01T23:34:08.305502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:08.446253Z","title":"Towards scientific intelligence: A survey of llm-based scientific agents.arXiv preprint arXiv:2503.24047, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.446253Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:dc833cdbeff8cbff3b425a4820c3c66958a103309419a03de31a3f6f98a077d4","observation_id":"a3640d7a-eadc-4e2f-a5c7-afa68282f0d8","resolution":{"observed_at":"2026-08-01T23:34:08.446253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-01T23:34:08.642754Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.642754Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:0e13f490a365e944aec272b90fb61939a4b7c6a533e4a73dbfda4730fb094b77","observation_id":"1cb9daf5-7438-4253-9abd-ac506e51c305","resolution":{"observed_at":"2026-08-01T23:34:08.642754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:08.734542Z","title":"Can llms correct them- selves? a benchmark of self-correction in llms.arXiv preprint arXiv:2510.16062, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.734542Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:43d3340a7410882d58954528ab92b7f675ad50246e613ecd7d5c4f0c071b0a7e","observation_id":"0c60c6a2-bd0e-49b2-98f6-9a1564af8107","resolution":{"observed_at":"2026-08-01T23:34:08.734542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06322","last_updated":"2025-01-10T19:56:50Z","snapshot_observed_at":"2026-07-30T22:07:13.869232Z","submitted_at":"2025-01-10T19:56:50Z","title":"Multi-Agent Collaboration Mechanisms: A Survey of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06322","snapshot_observed_at":"2026-08-01T23:34:08.868842Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.868842Z"},"links":{"cited_paper":"/paper/2501.06322","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:8538fc3d109c13f7d3583c1c33e6a742e85c9ed212b1fc9f63bd41a4aecdb133","observation_id":"d8195945-d22a-4014-9600-36b09c49f097","resolution":{"observed_at":"2026-08-01T23:34:08.868842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:08.999850Z","title":"Self-correction bench: Uncovering and addressing the self-correction blind spot in large language models.OpenReview, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:08.999850Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:4cb35ca312a1875bb3c34e0b1ba01747182264ba9c1f94c94e551de8db39358e","observation_id":"03aecc9f-9a42-46e1-b96c-81e31afb5bb8","resolution":{"observed_at":"2026-08-01T23:34:08.999850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-01T23:34:09.101806Z","title":"Le, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.101806Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:446847c9b26b9e33dc9b00aac5700c5724c223e5784be3ca36acefa3c696a681","observation_id":"c5fd9750-3627-44b5-8ad7-cbd3003bf917","resolution":{"observed_at":"2026-08-01T23:34:09.101806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-01T23:34:09.206984Z","title":"Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.206984Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:5dfb4f51bd545b1f2f7083ee5d8a463241dcb33162deff7df828526bbc890065","observation_id":"bc3468bd-8320-4030-b3f9-f885ad0a43be","resolution":{"observed_at":"2026-08-01T23:34:09.206984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:09.317994Z","title":"Can LLM agents really debate? a controlled study of multi-agent debate in logical reasoning.arXiv preprint arXiv:2511.07784, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.317994Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:4014d4ad816f0eacc91412419dec1008e05b4f12d1fa7dab9b6e0086942a6afd","observation_id":"920b6124-5843-427c-84b4-11e20deecfc5","resolution":{"observed_at":"2026-08-01T23:34:09.317994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08155","last_updated":"2023-10-03T20:47:10Z","snapshot_observed_at":"2026-07-31T19:03:03.494918Z","submitted_at":"2023-08-16T05:57:52Z","title":"AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.08155","snapshot_observed_at":"2026-08-01T23:34:09.454099Z","title":"White, Doug Burger, and Chi Wang","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.454099Z"},"links":{"cited_paper":"/paper/2308.08155","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:f4e01815fa3981bfd352dfd6d258842d65a43a0c46eb3915e4cf949a14323711","observation_id":"ee57ea8a-2eb3-48ca-91d1-7d5419098410","resolution":{"observed_at":"2026-08-01T23:34:09.454099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19513","last_updated":"2024-12-27T08:09:11Z","snapshot_observed_at":"2026-07-06T20:13:36.042546Z","submitted_at":"2024-12-27T08:09:11Z","title":"Confidence v.s. Critique: A Decomposition of Self-Correction Capability for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19513","snapshot_observed_at":"2026-08-01T23:34:09.539719Z","title":"Con- fidence v.s","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.539719Z"},"links":{"cited_paper":"/paper/2412.19513","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:069983843c5f6d6ba75ac65b722ab787acf8ee4adb96ae6f44abd82cccfa3694","observation_id":"0968b8c3-d473-4d4f-a221-e804f64a17f1","resolution":{"observed_at":"2026-08-01T23:34:09.539719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10601","last_updated":"2023-12-03T22:50:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T23:16:17Z","title":"Tree of Thoughts: Deliberate Problem Solving with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10601","snapshot_observed_at":"2026-08-01T23:34:09.629909Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.629909Z"},"links":{"cited_paper":"/paper/2305.10601","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:81fb2e22843eec7084813f2bfa5c10af397c1931232fd57864e3b6d3e1e4c614","observation_id":"10043a02-738e-4f71-8cc2-46530b4140f0","resolution":{"observed_at":"2026-08-01T23:34:09.629909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16416","last_updated":"2026-04-23T17:36:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-20T17:59:23Z","title":"Survey on Evaluation of LLM-based Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16416","snapshot_observed_at":"2026-08-01T23:34:09.710058Z","title":"Survey on evaluation of llm-based agents.arXiv preprint arXiv:2503.16416, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.710058Z"},"links":{"cited_paper":"/paper/2503.16416","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:b08f8337c2f04dfdad5bea097cd071c8f94d2d50244e7b13f77a4d5b6f410736","observation_id":"c10dd3e5-58fc-489d-94eb-b793c9554495","resolution":{"observed_at":"2026-08-01T23:34:09.710058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08379","last_updated":"2025-06-10T02:43:47Z","snapshot_observed_at":"2026-08-07T05:09:55.979992Z","submitted_at":"2025-06-10T02:43:47Z","title":"Reinforce LLM Reasoning through Multi-Agent Reflection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08379","snapshot_observed_at":"2026-08-01T23:34:09.797820Z","title":"Reinforce LLM reasoning through multi-agent reflection.arXiv preprint arXiv:2506.08379, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.797820Z"},"links":{"cited_paper":"/paper/2506.08379","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:a13453b87f03427ba0644411c77607fd52a3177eba7e99ff5669351749fe9013","observation_id":"7dbf8087-3485-4e26-9fd2-531ae83c4e6d","resolution":{"observed_at":"2026-08-01T23:34:09.797820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24235","last_updated":"2025-05-04T15:48:08Z","snapshot_observed_at":"2026-08-07T23:06:45.603790Z","submitted_at":"2025-03-31T15:46:15Z","title":"A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24235","snapshot_observed_at":"2026-08-01T23:34:09.881076Z","title":"A survey on test- time scaling in large language models: What, how, where, and how well?arXiv preprint arXiv:2503.24235, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.881076Z"},"links":{"cited_paper":"/paper/2503.24235","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:e4f61b9f242bf7fed221e1591b1cc3022e3baeab802c2a6611e80a58bce569c2","observation_id":"c3f52520-79bc-49b9-9ab5-59ebf80e1509","resolution":{"observed_at":"2026-08-01T23:34:09.881076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:09.964586Z","title":"Small language models need strong verifiers to self-correct reasoning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:09.964586Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:4a35078debd841e4c98d51e1d439118995a5d5f2212be2c58ecb25a843559dcb","observation_id":"7ccc4a33-b726-4b50-b95a-1191dffcb24e","resolution":{"observed_at":"2026-08-01T23:34:09.964586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15253","last_updated":"2025-05-21T23:42:20Z","snapshot_observed_at":"2026-08-07T16:00:30.724746Z","submitted_at":"2025-04-21T17:33:23Z","title":"Evaluating Judges as Evaluators: The JETTS Benchmark of LLM-as-Judges as Test-Time Scaling Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15253","snapshot_observed_at":"2026-08-01T23:34:10.038013Z","title":"Evaluating judges as evaluators: The jetts benchmark of llm-as-judges as test-time scaling evaluators.arXiv preprint arXiv:2504.15253, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.038013Z"},"links":{"cited_paper":"/paper/2504.15253","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:22a798f570833d4dfb10f14b9a9d5365537b1722a30dacf9046890ca7b910821","observation_id":"cf7f5c99-4b5e-4db2-9b3a-f92db4a927ac","resolution":{"observed_at":"2026-08-01T23:34:10.038013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02825","last_updated":"2025-08-07T06:58:08Z","snapshot_observed_at":"2026-08-06T22:15:42.048508Z","submitted_at":"2025-07-03T17:35:31Z","title":"Establishing Best Practices for Building Rigorous Agentic Benchmarks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02825","snapshot_observed_at":"2026-08-01T23:34:10.122008Z","title":"Self-correction blind spot","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.122008Z"},"links":{"cited_paper":"/paper/2507.02825","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:d0f8bf3509e185dd858575dd4b01532bc9ad355a6dfaf1ea0fc694917881c793","observation_id":"ad9430a8-1636-4380-a69e-32bdca129aca","resolution":{"observed_at":"2026-08-01T23:34:10.122008Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.218624Z","title":"useful” and “misleading","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.218624Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:8ad32842569bf0a419d93eae4af83967b645b1fcdc960c1c0a315f930feadaa4","observation_id":"d8c4e30e-7b1d-4397-b872-0e12201c7fc5","resolution":{"observed_at":"2026-08-01T23:34:10.218624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.309632Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.309632Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:0c3edcfb71386eb181ce78845054663c023b2581de1312da5261900ae73ed931","observation_id":"cad18796-d777-4396-957f-386b92c24658","resolution":{"observed_at":"2026-08-01T23:34:10.309632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.388391Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.388391Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:99b64f34c3d5a8cbc72e239b792cb41f6b348b5b7a858286b273d9ec70f6e618","observation_id":"e4471bb6-c271-4c7c-99c8-d05ff01e1582","resolution":{"observed_at":"2026-08-01T23:34:10.388391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.478432Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.478432Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:150a4ce5a50c2e5568381505ea47dc0b472086a7a8cb4c3b2ab3681698578e49","observation_id":"9dd02216-17b5-4e81-b764-9de6638cc68a","resolution":{"observed_at":"2026-08-01T23:34:10.478432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.578951Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.578951Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:10012a19ef7b84377cd95299dd4842db750cf4b687f9ebd1299bea5bbb10937c","observation_id":"9ad57cec-5bdb-47a0-9059-68e4061bf554","resolution":{"observed_at":"2026-08-01T23:34:10.578951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.677408Z","title":"wrong → same wrong answer,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.677408Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:34b2d60b6ea53e539c018118dbf0ed35c90696b9a831a70cb4f0251de16d000c","observation_id":"d68631ab-0d3e-48e9-9b92-62d01dc6c367","resolution":{"observed_at":"2026-08-01T23:34:10.677408Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:10.768149Z","title":"Guidelines: • The answer [N/A] means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:10.768149Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:73fd4012aa4a5453c831286cb501e8fae4c1886917deed955ca8b57169227e6b","observation_id":"8c1ad37e-21ba-4226-bfeb-c4654a353f8a","resolution":{"observed_at":"2026-08-01T23:34:10.768149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T23:34:07.685579Z","title":null,"venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:07.685579Z"},"links":{"citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:39b911f109d3bb53434df8343104766fb2efc0744e14d436b74f70e4b7e76b92","observation_id":"d3cedc27-8928-457c-9ae1-94ed70a3bb02","resolution":{"observed_at":"2026-08-01T23:34:07.685579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04622","last_updated":"2024-07-12T16:38:12Z","snapshot_observed_at":"2026-08-02T16:31:30.812187Z","submitted_at":"2024-07-05T16:29:15Z","title":"On scalable oversight with weak LLMs judging strong LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04622","snapshot_observed_at":"2026-08-01T23:34:06.878529Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:06.878529Z"},"links":{"cited_paper":"/paper/2407.04622","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:2b8cc9d56cac4e53d4247dd34557ea61f7928f3256464de217ee2c06b3145bfb","observation_id":"30cadc61-c180-4eb7-9a91-0179bf43d24b","resolution":{"observed_at":"2026-08-01T23:34:06.878529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13657","last_updated":"2025-10-26T23:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-17T19:04:38Z","title":"Why Do Multi-Agent LLM Systems Fail?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13657","snapshot_observed_at":"2026-08-01T23:34:05.935527Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T23:34:05.935527Z"},"links":{"cited_paper":"/paper/2503.13657","citing_paper":"/paper/2607.15388"},"observation_digest":"sha256:33b9be595e21050bbf39c3e765e32fccd4703047c39278d0c85fa7e0f4a7a47e","observation_id":"e508252e-3f21-4cb6-bdd4-1aad689f6499","resolution":{"observed_at":"2026-08-01T23:34:05.935527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15388","last_updated":"2026-07-16T18:38:10Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:47:55.675443Z","submitted_at":"2026-07-16T18:38:10Z","title":"Precise but Uncoupled: Reviewer Precision Does Not Guarantee Critique Uptake in Multi-Agent Math Reasoning"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2607.15388."}