{"as_of":"2026-08-08T20:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0a1caa11a8fde942305359d8a412b5e9a4c73af3dd6117dac3fa1f2767a32341","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":38,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T12:17:55.260097Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":8,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-08T12:17:55.260097Z","title":"Llm critics help catch llm bugs, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07577","last_updated":"2025-06-09T17:49:46Z","snapshot_observed_at":"2026-08-08T12:13:06.365821Z","submitted_at":"2025-02-11T14:23:13Z","title":"Automated Capability Discovery via Foundation Model Self-Exploration","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T12:17:55.260097Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2502.07577"},"observation_digest":"sha256:28a2e510667dbd6551adfd26ffd6249c84edeb31ded478a1ff38432ef72bfee3","observation_id":"9bbd0236-5e0d-4e77-9466-a2c223a80c5e","resolution":{"observed_at":"2026-08-08T12:17:55.260097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:2843af35d51e4e9c55e1cbe995f1753cdb6fa70c18891d374a34bb0c2cba8a31","observation_id":"ee956037-fb1a-4883-9db4-5f2edfa415a8","resolution":{"observed_at":"2026-05-10T13:41:08.064965Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T15:12:36.041322Z","title":"Nat McAleese, Rai Michael Pokorny, Juan Felipe Cer’on Uribe, Evgenia Nitishinskaya, Maja Trebacz, and Jan Leike","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16086","last_updated":"2025-08-06T22:30:21Z","snapshot_observed_at":"2026-08-07T15:04:56.046600Z","submitted_at":"2025-05-22T00:00:27Z","title":"Optimizing LLM-Based Multi-Agent System with Textual Feedback: A Case Study on Software Development","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:12:36.041322Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2505.16086"},"observation_digest":"sha256:3d67406da80e950a33d15bf10b76025238f603849fd8d03599c6439566b8ec49","observation_id":"71262754-d894-4f4a-a2d8-3c63aa8ffb1a","resolution":{"observed_at":"2026-08-07T15:12:36.041322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T12:17:44.997683Z","title":"Daniel McFadden","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00172","last_updated":"2025-05-30T19:23:51Z","snapshot_observed_at":"2026-08-07T12:08:36.149376Z","submitted_at":"2025-05-30T19:23:51Z","title":"Breakpoint: Scalable evaluation of system-level reasoning in LLM code agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:17:44.997683Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2506.00172"},"observation_digest":"sha256:131689a08bbdafb053b3e4b5793e33581c61eb70f7f4ab391f4151c15c043e40","observation_id":"d664ad6a-ee01-489f-9aac-0f635ddb0cc3","resolution":{"observed_at":"2026-08-07T12:17:44.997683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T12:13:29.658971Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00296","last_updated":"2025-05-30T22:58:35Z","snapshot_observed_at":"2026-08-07T12:06:04.405238Z","submitted_at":"2025-05-30T22:58:35Z","title":"CRScore++: Reinforcement Learning with Verifiable Tool and AI Feedback for Code Review","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:13:29.658971Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2506.00296"},"observation_digest":"sha256:9f80bacf74cc9290fc407f587cf4e417c9e52241dec4a84dd9a854660230e14d","observation_id":"b36489cf-d06b-4897-b3c9-75ceb9958269","resolution":{"observed_at":"2026-08-07T12:13:29.658971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T11:04:00.096836Z","title":"M., Uribe, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03573","last_updated":"2025-06-04T04:43:15Z","snapshot_observed_at":"2026-08-08T06:29:45.695775Z","submitted_at":"2025-06-04T04:43:15Z","title":"Exchange of Perspective Prompting Enhances Reasoning in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:00.096836Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2506.03573"},"observation_digest":"sha256:97decc172ae21cf3affef01b060946ce5014d743a7d7559ef2aec8d2056d3c39","observation_id":"b97f700a-87c7-4fa0-8cb7-7840c538bd65","resolution":{"observed_at":"2026-08-07T11:04:00.096836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T10:17:47.148271Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.10019","last_updated":"2025-06-06T11:09:46Z","snapshot_observed_at":"2026-08-08T16:55:23.964977Z","submitted_at":"2025-06-06T11:09:46Z","title":"A Survey of Automatic Evaluation Methods on Text, Visual and Speech Generations","version":1},"reference_index":261,"source":"pdf_text","source_observed_at":"2026-08-07T10:17:47.148271Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2506.10019"},"observation_digest":"sha256:b3b347b7f28cc9f8ba671d1f2eff1082b8042f4efd8cd73bfdc9a450dfbe6e9f","observation_id":"12932292-e91b-4517-9c01-14b43c65cf96","resolution":{"observed_at":"2026-08-07T10:17:47.148271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T04:44:03.053326Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.13977","last_updated":"2025-06-11T17:59:18Z","snapshot_observed_at":"2026-08-07T10:32:04.299927Z","submitted_at":"2025-06-11T17:59:18Z","title":"CRITICTOOL: Evaluating Self-Critique Capabilities of Large Language Models in Tool-Calling Error Scenarios","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T04:44:03.053326Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2506.13977"},"observation_digest":"sha256:f8b64972078d288bccd5d1cfe02c6a4a147eafa64201dc4c0d02c395ea5d378b","observation_id":"02bc1dfe-46d6-417a-bbef-fef24ef561b9","resolution":{"observed_at":"2026-08-07T04:44:03.053326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T20:15:52.764833Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.03483","last_updated":"2025-07-08T05:05:04Z","snapshot_observed_at":"2026-08-08T08:25:33.597241Z","submitted_at":"2025-07-04T11:20:09Z","title":"BMMR: A Large-Scale Bilingual Multimodal Multi-Discipline Reasoning Dataset","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T20:15:52.764833Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2507.03483"},"observation_digest":"sha256:16d229557bff86e4d702dc421d8bc522171142d0394e931ab5e61ad5453ba56e","observation_id":"7fae0959-5729-4815-b117-045361ba19bc","resolution":{"observed_at":"2026-08-06T20:15:52.764833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T17:32:32.445876Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10535","last_updated":"2025-08-14T17:58:50Z","snapshot_observed_at":"2026-08-06T17:26:10.296563Z","submitted_at":"2025-07-14T17:56:29Z","title":"CodeJudgeBench: Benchmarking LLM-as-a-Judge for Coding Tasks","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T17:32:32.445876Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2507.10535"},"observation_digest":"sha256:b58d5a3d07f903e042cc46f3acd6cbb80771ca462e27f71a2154c253928c9b66","observation_id":"6868fb9f-f436-4f7d-959a-d7d92e1ba5c1","resolution":{"observed_at":"2026-08-06T17:32:32.445876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-07T08:44:55.120774Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-20T14:19:44.695462Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2507.11473"},"observation_digest":"sha256:1891ab94aa0039f082ec8700191aa17c608b2596038a5cd0efe3a0971981103a","observation_id":"d82d28eb-19e1-4866-b18f-23d8360e1bd6","resolution":{"observed_at":"2026-05-20T14:19:44.746613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T15:47:32.141323Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15024","last_updated":"2025-07-20T16:19:51Z","snapshot_observed_at":"2026-08-07T23:16:39.881011Z","submitted_at":"2025-07-20T16:19:51Z","title":"RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T15:47:32.141323Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2507.15024"},"observation_digest":"sha256:2b224d7ee8858732e9f8dbcee713fcc57ab77251114dfa9630fc28ba973a9e72","observation_id":"395ff2a7-3a94-42ad-afc1-0e52bc8d9e71","resolution":{"observed_at":"2026-08-06T15:47:32.141323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2507.15698","last_updated":"2026-05-19T07:11:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-21T15:07:59Z","title":"CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-21T23:24:43.556606Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2507.15698"},"observation_digest":"sha256:cc72458df955414ccdea81476126ef4677a4070a134ea390a8acfd643a345e39","observation_id":"9adddc11-31b6-4e55-a087-ba9a64a6eb06","resolution":{"observed_at":"2026-05-21T23:25:45.268233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T05:46:52.666443Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.01279","last_updated":"2025-08-02T09:19:16Z","snapshot_observed_at":"2026-08-06T05:46:49.578640Z","submitted_at":"2025-08-02T09:19:16Z","title":"ViseGPT: Towards Better Alignment of LLM-generated Data Wrangling Scripts and User Prompts","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T05:46:52.666443Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2508.01279"},"observation_digest":"sha256:5916e3899db1d1e0d4d602b9b3957171c76ff4ec3640e6401d9ba626f5a1db61","observation_id":"da4951f9-e021-4c94-b175-b9086c68171d","resolution":{"observed_at":"2026-08-06T05:46:52.666443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T01:02:51.111485Z","title":"M.; Uribe, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.03990","last_updated":"2025-08-06T00:45:02Z","snapshot_observed_at":"2026-08-07T19:01:14.058600Z","submitted_at":"2025-08-06T00:45:02Z","title":"Are Today's LLMs Ready to Explain Well-Being Concepts?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T01:02:51.111485Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2508.03990"},"observation_digest":"sha256:e89bc6feb577f8ce05f742c817fd52928b80ddc10c809e42f1ad9b3074d62259","observation_id":"b0539d43-abd0-461c-8d1c-864fe2e38c9e","resolution":{"observed_at":"2026-08-06T01:02:51.111485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T22:09:46.553605Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07434","last_updated":"2025-08-10T17:11:56Z","snapshot_observed_at":"2026-08-07T02:35:17.826871Z","submitted_at":"2025-08-10T17:11:56Z","title":"Let's Revise Step-by-Step: A Unified Local Search Framework for Code Generation with LLMs","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T22:09:46.553605Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2508.07434"},"observation_digest":"sha256:fe16761731a6ba3d8c25b4e818c2a92693c75dd640b402b365422ed7c8ec8b34","observation_id":"48faffc0-1935-46f9-a8d2-a314fba9378f","resolution":{"observed_at":"2026-08-05T22:09:46.553605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T14:38:06.861926Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21061","last_updated":"2025-08-28T17:58:29Z","snapshot_observed_at":"2026-08-08T13:39:42.517111Z","submitted_at":"2025-08-28T17:58:29Z","title":"OnGoal: Tracking and Visualizing Conversational Goals in Multi-Turn Dialogue with Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:38:06.861926Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2508.21061"},"observation_digest":"sha256:09d7943dceac01425c19c0124d19e01da17b045a41f3c2e3f6853649fe629af3","observation_id":"8a10b93e-dbd6-43be-9e52-76ceea82646f","resolution":{"observed_at":"2026-08-05T14:38:06.861926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T12:56:35.136328Z","title":"Llm critics help catch llm bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01142","last_updated":"2025-09-01T05:30:56Z","snapshot_observed_at":"2026-08-08T06:17:53.010186Z","submitted_at":"2025-09-01T05:30:56Z","title":"Dream-Coder 7B: An Open Diffusion Language Model for Code","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T12:56:35.136328Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2509.01142"},"observation_digest":"sha256:9a8e6498915ae79874577e92f30f03ec08e70fa476453a7590de3e53fa76f678","observation_id":"007db2f9-132e-4e26-8ae4-18318fdfbb5d","resolution":{"observed_at":"2026-08-05T12:56:35.136328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-04T07:21:22.511988Z","title":"McAleese, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.26518","last_updated":"2026-06-25T13:34:02Z","snapshot_observed_at":"2026-08-06T18:42:20.655223Z","submitted_at":"2025-10-30T14:11:52Z","title":"Human-AI Complementarity: A Goal for Amplified Oversight","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T07:21:22.511988Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2510.26518"},"observation_digest":"sha256:04262bd0c8038d21d54d8b039f7f40e83f23924adcfd8cec1502571e43940083","observation_id":"983d0e01-9175-409f-93ce-b594b6db0d16","resolution":{"observed_at":"2026-08-04T07:21:22.511988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2601.06794","last_updated":"2026-04-14T15:14:10Z","snapshot_observed_at":"2026-08-02T16:11:51.558737Z","submitted_at":"2026-01-11T07:29:08Z","title":"No More Stale Feedback: Co-Evolving Critics for Open-World Agent Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T16:01:48.789986Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2601.06794"},"observation_digest":"sha256:dcada1cc32ae916fda68fdbf10d90cb2f051aad53df4456bc80e9c2fe304efe1","observation_id":"b1730ac7-4802-48f8-9c5f-ae186195875e","resolution":{"observed_at":"2026-05-16T16:03:04.279092Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2604.07341","last_updated":"2026-08-05T04:26:04Z","snapshot_observed_at":"2026-08-08T20:09:22.824251Z","submitted_at":"2026-04-08T17:54:08Z","title":"ReCodeAgent: A Multi-agent Workflow for Language-Agnostic Translation and Validation of Large-Scale Repositories","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T17:29:37.642356Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2604.07341"},"observation_digest":"sha256:a004d16a9151703b80fc57264e610f37c518e4fe80697fc4360ae3cff2b2224f","observation_id":"28fe0286-729e-4c34-97ad-3e29aef28991","resolution":{"observed_at":"2026-05-11T06:41:36.059248Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:e466e452a35a66c8eb08597b000414ec0171956003e1e18b75bb4fc5787b2aa1","observation_id":"a5806370-9914-4158-9a1a-0b5fc8847c67","resolution":{"observed_at":"2026-05-11T13:46:04.557005Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2604.24955","last_updated":"2026-04-27T19:51:25Z","snapshot_observed_at":"2026-07-06T23:10:52.763251Z","submitted_at":"2026-04-27T19:51:25Z","title":"BenchGuard: Who Guards the Benchmarks? Automated Auditing of LLM Agent Benchmarks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-08T03:30:55.419225Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2604.24955"},"observation_digest":"sha256:24deb205c5dc06ad57e691471a25ec3fabfc4c8184450d1ec89c1d4c0b9b2512","observation_id":"954bd355-01ed-4240-a08c-369ca313ce8e","resolution":{"observed_at":"2026-05-09T00:24:28.369167Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2605.01643","last_updated":"2026-05-11T16:34:28Z","snapshot_observed_at":"2026-08-02T23:40:34.893411Z","submitted_at":"2026-05-02T23:28:02Z","title":"AI Alignment via Incentives and Correction","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-09T14:07:44.717260Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2605.01643"},"observation_digest":"sha256:a7c1d356c150bde67bb060784a252dc357e10f6205ec7334ee5bf2188562d956","observation_id":"0435cd55-1b72-478f-b536-62a92a510796","resolution":{"observed_at":"2026-05-11T17:01:10.325818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2605.01643","last_updated":"2026-05-11T16:34:28Z","snapshot_observed_at":"2026-08-02T23:40:34.893411Z","submitted_at":"2026-05-02T23:28:02Z","title":"AI Alignment via Incentives and Correction","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T04:51:31.357544Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2605.01643"},"observation_digest":"sha256:9460eb7b8d0841513abdb74898cbd192adf9e5130efd696aa6ff9941488ebef6","observation_id":"647e6ab5-a8ed-487c-80aa-51a9564a395b","resolution":{"observed_at":"2026-05-12T05:51:26.693683Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2605.08321","last_updated":"2026-05-08T16:23:47Z","snapshot_observed_at":"2026-07-06T23:20:33.816373Z","submitted_at":"2026-05-08T16:23:47Z","title":"LLM Wardens: Mitigating Adversarial Persuasion with Third-Party Conversational Oversight","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T00:51:17.434889Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2605.08321"},"observation_digest":"sha256:30fec76e4c404d2708bc6e1122532d54f6b51a6721427900c14bcb55c4818366","observation_id":"f47c57aa-73df-4737-95fe-b9752c8cb113","resolution":{"observed_at":"2026-05-12T08:41:24.528520Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2605.14311","last_updated":"2026-05-15T06:09:21Z","snapshot_observed_at":"2026-07-06T23:25:44.508166Z","submitted_at":"2026-05-14T03:23:44Z","title":"Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment","version":1},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-15T01:58:19.295247Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2605.14311"},"observation_digest":"sha256:23c5c2534b026711e00702b4c7f4050c3d1e3dfa96027b8d71939360ac64be93","observation_id":"21af213a-b98c-4ed4-820b-f4daf76d597f","resolution":{"observed_at":"2026-05-15T01:58:28.867558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2605.14311","last_updated":"2026-05-15T06:09:21Z","snapshot_observed_at":"2026-07-06T23:25:44.508166Z","submitted_at":"2026-05-14T03:23:44Z","title":"Beyond Binary: Reframing GUI Critique as Continuous Semantic Alignment","version":2},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-19T16:45:16.963802Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2605.14311"},"observation_digest":"sha256:e73772d111de9c0a6fb4d8d65f83fd2ae9632f1644d05ca95f7768dd622c5c87","observation_id":"fd0fc45f-6ddd-4935-a697-a8f60dc628b8","resolution":{"observed_at":"2026-05-19T16:47:40.465434Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2605.23108","last_updated":"2026-05-21T23:57:25Z","snapshot_observed_at":"2026-07-06T23:33:24.215365Z","submitted_at":"2026-05-21T23:57:25Z","title":"Philosophical Dispositions as Behavioral Constraints for AI-Assisted Code Review: An Empirical Study","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-25T05:07:12.832683Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2605.23108"},"observation_digest":"sha256:8144c5f84cb1604fe0ec09a9700ace751251492ad1ea7919b56238d215b94dc6","observation_id":"580e838f-3c39-49ec-ae90-046e36b15931","resolution":{"observed_at":"2026-05-25T05:10:22.403624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":"2407.00215","doi":"10.48550/arxiv.2407.00215","metadata_source":"arxiv_reference","pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLM Critics Help Catch LLM Bugs","venue":"arXiv (Cornell University)","work_id":"e730c1aa-4c9b-48f3-923b-47ddc0a4e6d8","year":2024},"citing_paper":{"arxiv_id":"2606.00424","last_updated":"2026-05-29T23:21:48Z","snapshot_observed_at":"2026-08-02T07:23:01.039858Z","submitted_at":"2026-05-29T23:21:48Z","title":"Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T21:55:58.645062Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2606.00424"},"observation_digest":"sha256:fd2925a3910ca994b4540c4bc75e4f774b4908b5c324e8c69185c2682dda4106","observation_id":"e8979a3c-728b-483d-bbb9-c65035c546bb","resolution":{"observed_at":"2026-07-01T19:56:10.983153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-02T00:50:39.714101Z","title":"LLM critics help catch LLM bugs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14890","last_updated":"2026-07-16T12:06:21Z","snapshot_observed_at":"2026-08-07T11:53:52.104190Z","submitted_at":"2026-07-16T12:06:21Z","title":"Proof-or-Stop: Don't Trust the Agent, Trust the Evidence -- Loop Engineering for Verifiable Evidence-Gated Lifecycle Control","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:50:39.714101Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2607.14890"},"observation_digest":"sha256:7a07c2815a23f15c9b5821ee4b75856ca1aa4530c84b5d2877e78d6dfd68604f","observation_id":"75ea0ca6-6ce5-4326-9f02-775fcb3bd834","resolution":{"observed_at":"2026-08-02T00:50:39.714101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-01T21:14:42.470394Z","title":"McAleese, R","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16387","last_updated":"2026-07-29T10:57:37Z","snapshot_observed_at":"2026-08-07T04:50:09.161801Z","submitted_at":"2026-07-17T17:41:16Z","title":"Fantastic Adaptive Taxonomies and How to Use Them","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:14:42.470394Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2607.16387"},"observation_digest":"sha256:cd73b75800a865d366f4dc988b20346c64927a1cfaa58cedd44a6eca46c2d581","observation_id":"ee3d1936-9e66-4f5c-933f-b42f661aa8ea","resolution":{"observed_at":"2026-08-01T21:14:42.470394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-01T09:12:25.169891Z","title":"arXiv preprint arXiv:2407.00215 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.20852","last_updated":"2026-07-23T02:23:09Z","snapshot_observed_at":"2026-08-07T07:14:22.441962Z","submitted_at":"2026-07-23T02:23:09Z","title":"Code Monitor Red Teaming for Public-Test-Passing Code","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T09:12:25.169891Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2607.20852"},"observation_digest":"sha256:f652b622ee3ffa378a44ca11c4afe492e5a6b4de7410f28f998e22118d86ca5c","observation_id":"5a5900ed-38ad-4d3e-b70c-10be22d5ff0d","resolution":{"observed_at":"2026-08-01T09:12:25.169891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-07-31T01:28:21.684871Z","title":"Evaluation of an llm in identifying logical fallacies: A call for rigor when adopting llms in hci research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.27499","last_updated":"2026-07-29T22:30:59Z","snapshot_observed_at":"2026-08-08T01:42:21.484843Z","submitted_at":"2026-07-29T22:30:59Z","title":"A dataset of rated conceptual arguments","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-31T01:28:21.684871Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2607.27499"},"observation_digest":"sha256:a2927045c2b701b9a17a3934060525b803cd3748eb3008ea86c49b20cd766984","observation_id":"b5b8ce2a-122f-47d0-b665-1c83909c0789","resolution":{"observed_at":"2026-07-31T01:28:21.684871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-07-31T07:20:10.899680Z","title":"arXiv preprint arXiv:2407.00215 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28439","last_updated":"2026-07-31T05:50:45Z","snapshot_observed_at":"2026-08-06T04:42:08.746259Z","submitted_at":"2026-07-30T16:13:36Z","title":"Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-07-31T07:20:10.899680Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2607.28439"},"observation_digest":"sha256:d9359feb5c0a1ed3246be50689412e518b54d0c0c91081787c6e4dc9cfc5b941","observation_id":"c37075e3-5fbb-44c3-91c3-1f907f29e722","resolution":{"observed_at":"2026-07-31T07:20:10.899680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-03T01:25:30.883047Z","title":"arXiv preprint arXiv:2407.00215 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28439","last_updated":"2026-07-31T05:50:45Z","snapshot_observed_at":"2026-08-06T04:42:08.746259Z","submitted_at":"2026-07-30T16:13:36Z","title":"Beyond a Single Judge: The Evidence-Grounded, Social-Weighted Persona Panel for Generative UI Evaluation","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T01:25:30.883047Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2607.28439"},"observation_digest":"sha256:028b7bc275620f0b9d15273895a5df7b624fc70243e3b0f28ba72c9097617ead","observation_id":"088a8d31-2fec-43ca-9875-79c8f24ad036","resolution":{"observed_at":"2026-08-03T01:25:30.883047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-06T00:43:00.039128Z","title":"LLM critics help catch LLM bugs.arXiv preprint arXiv:2407.00215, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-08T18:38:19.805040Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T00:43:00.039128Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:bf2adeb70c0a609a87e2e4c639139a034c6a962df7d4577cdd0febb739369086","observation_id":"12947eb9-15c3-41cd-ac6d-73160fddd018","resolution":{"observed_at":"2026-08-06T00:43:00.039128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00215","snapshot_observed_at":"2026-08-07T00:14:07.111956Z","title":"LLM critics help catch LLM bugs.arXiv preprint arXiv:2407.00215, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02713","last_updated":"2026-08-03T17:59:58Z","snapshot_observed_at":"2026-08-07T23:09:56.055766Z","submitted_at":"2026-08-03T17:59:58Z","title":"Quo Vadis, World Modeling?","version":1},"reference_index":112,"source":"pdf_text","source_observed_at":"2026-08-07T00:14:07.111956Z"},"links":{"cited_paper":"/paper/2407.00215","citing_paper":"/paper/2608.02713"},"observation_digest":"sha256:791e9010e454b5ae52148d5ce7fca0ac9b1acf7f266593faa8813ad91856b164","observation_id":"1b97cf54-a4ec-4b8a-a023-7d41cfc8b182","resolution":{"observed_at":"2026-08-07T00:14:07.111956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2407.00215/citation-record","integrity":"/paper/2407.00215/integrity","json":"/paper/2407.00215/citation-record.json","paper":"/paper/2407.00215"},"outbound":[],"paper":{"arxiv_id":"2407.00215","last_updated":"2024-06-28T19:53:17Z","latest_version":1,"primary_category":"cs.SE","snapshot_observed_at":"2026-07-06T18:38:46.314431Z","submitted_at":"2024-06-28T19:53:17Z","title":"LLM Critics Help Catch LLM Bugs"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 38 inbound Pith citation observations for arXiv:2407.00215."}