{"as_of":"2026-08-09T14:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:924e1459d584835d1d0ab1e928fdadb4b01cf68f7d2705339dde3de68cb7707b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":35,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T13:25:51.952653Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:43df40ca51e1ab241a7dceee7fa9c8b56151a88b66946ffd6d93ef8b66c8a549","observation_id":"29829418-edc8-4424-97e7-1a55043c0341","resolution":{"observed_at":"2026-05-23T17:35:44.196635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-09T13:25:51.952653Z","title":"Chang, and Prithviraj Ammanabrolu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.02095","last_updated":"2025-05-20T12:35:46Z","snapshot_observed_at":"2026-08-09T13:18:52.481806Z","submitted_at":"2025-02-04T08:25:17Z","title":"LongDPO: Unlock Better Long-form Generation Abilities for LLMs via Critique-augmented Stepwise Information","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T13:25:51.952653Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2502.02095"},"observation_digest":"sha256:374aa785d4a6ceed9d501d453997df5b10d2587a3bae9bc73af097143b2e70fd","observation_id":"17da07b9-2710-45f1-9cf5-6f066c4a1b67","resolution":{"observed_at":"2026-08-09T13:25:51.952653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:3d03042c60213c07c84963f02c1daf5d50c200a5e4eff1fb5c3291421f79d820","observation_id":"4f674538-c9d1-4632-97fa-bcf9647e8a61","resolution":{"observed_at":"2026-05-22T19:32:01.313460Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T15:09:54.211281Z","title":"Critique-out-loud reward models.arXiv preprint arXiv:2408.11791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16265","last_updated":"2025-05-22T05:56:11Z","snapshot_observed_at":"2026-08-07T15:02:24.736790Z","submitted_at":"2025-05-22T05:56:11Z","title":"Think-RM: Enabling Long-Horizon Reasoning in Generative Reward Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:54.211281Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.16265"},"observation_digest":"sha256:3c3dd3e973932445125a9b5879928f41251eaa74c2f045906520d4c8f2994dbc","observation_id":"73873e99-f590-43c3-8f88-36992110828b","resolution":{"observed_at":"2026-08-07T15:09:54.211281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T14:34:53.519748Z","title":"Critique-out-loud reward models.arXiv preprint arXiv:2408.11791, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.18531","last_updated":"2025-05-24T05:50:07Z","snapshot_observed_at":"2026-08-08T01:18:16.590508Z","submitted_at":"2025-05-24T05:50:07Z","title":"Generative RLHF-V: Learning Principles from Multi-modal Human Preference","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:34:53.519748Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.18531"},"observation_digest":"sha256:71579743a4cacebf0f2ee8da21c29c292f1ea2da2dfa374e785ba52b0c996772","observation_id":"053d29f9-a696-4f8b-bf2c-3e99b8a48106","resolution":{"observed_at":"2026-08-07T14:34:53.519748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2505.20214","last_updated":"2026-04-16T15:26:31Z","snapshot_observed_at":"2026-07-30T07:26:26.144248Z","submitted_at":"2025-05-26T16:55:38Z","title":"When Slower Isn't Truer: Inverse Scaling Law of Truthfulness in Multimodal Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T12:47:36.228366Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.20214"},"observation_digest":"sha256:ed0adb3f07fd3cfafd9f3f6a7fc1cae2e1a162c61c8eb6fcb7e0ad4f7753f997","observation_id":"387c1d45-c326-44e0-a065-300f432830c8","resolution":{"observed_at":"2026-05-19T12:52:18.131065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T13:02:41.917221Z","title":"Critique-out-loud reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.22960","last_updated":"2025-06-20T03:07:38Z","snapshot_observed_at":"2026-08-09T05:48:09.867209Z","submitted_at":"2025-05-29T01:02:55Z","title":"Revisiting Multi-Agent Debate as Test-Time Scaling: A Systematic Study of Conditional Effectiveness","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:02:41.917221Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.22960"},"observation_digest":"sha256:68cd60163997e86a24b2528b9bdd2b20fd97e48572c642b8ad74077d32552ecb","observation_id":"50165dfc-02ec-42c5-b4e2-4589e29b9d64","resolution":{"observed_at":"2026-08-07T13:02:41.917221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T12:50:08.718847Z","title":"Hritik Bansal, Arian Hosseini, Rishabh Agarwal, Vinh Q","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23474","last_updated":"2025-05-29T14:26:53Z","snapshot_observed_at":"2026-08-09T05:03:49.587023Z","submitted_at":"2025-05-29T14:26:53Z","title":"Socratic-PRMBench: Benchmarking Process Reward Models with Systematic Reasoning Patterns","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T12:50:08.718847Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2505.23474"},"observation_digest":"sha256:5795e3535e8dc10922d4a958e7f976122403f44974421443135deac9a9ab7eca","observation_id":"61de2095-0d17-444c-88a6-01b3badfa06f","resolution":{"observed_at":"2026-08-07T12:50:08.718847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T11:36:43.442054Z","title":"Ankner, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01789","last_updated":"2025-06-03T04:18:39Z","snapshot_observed_at":"2026-08-08T11:39:24.709844Z","submitted_at":"2025-06-02T15:31:52Z","title":"Datasheets Aren't Enough: DataRubrics for Automated Quality Metrics and Accountability","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:36:43.442054Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.01789"},"observation_digest":"sha256:af6099a93cf7a9d896d0c75d8f86eefdaf5b58113c6ac55af1cf6f30f73ff06e","observation_id":"90199c7f-2665-4981-b314-6dc5fbad52c5","resolution":{"observed_at":"2026-08-07T11:36:43.442054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-19T11:18:03.965711Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.01937"},"observation_digest":"sha256:b7a6db04ceb5078d6549e217ec7d1fc8462655aa441c497b775bf00fd754a57f","observation_id":"3a461104-60f6-4eef-8872-5c714efec7d4","resolution":{"observed_at":"2026-05-19T11:22:16.798084Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T11:04:07.144776Z","title":"Critique-out-loud reward models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03637","last_updated":"2025-07-07T09:53:22Z","snapshot_observed_at":"2026-08-08T03:23:19.289933Z","submitted_at":"2025-06-04T07:30:16Z","title":"RewardAnything: Generalizable Principle-Following Reward Models","version":2},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T11:04:07.144776Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.03637"},"observation_digest":"sha256:036cb5641a30f7e500dafc3120c13f6c5f4bce3b960f0453fa8927203877e514","observation_id":"e2782c99-9211-4367-ad11-4a63a5f59a4f","resolution":{"observed_at":"2026-08-07T11:04:07.144776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T06:07:01.983009Z","title":"Chang, and Prithviraj Ammanabrolu","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06009","last_updated":"2025-06-06T11:54:06Z","snapshot_observed_at":"2026-08-09T07:03:13.377140Z","submitted_at":"2025-06-06T11:54:06Z","title":"Unlocking Recursive Thinking of LLMs: Alignment via Refinement","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:07:01.983009Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.06009"},"observation_digest":"sha256:2f784d4bef4c34899e78170a4d6fe3b555b98731b786acb26194418fbed702bd","observation_id":"47b801cc-3afb-4edc-95fa-edd60c593ab1","resolution":{"observed_at":"2026-08-07T06:07:01.983009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:26:46.991810Z","title":"Critique-out-loud reward models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07971","last_updated":"2025-06-09T17:45:18Z","snapshot_observed_at":"2026-08-09T13:06:51.941159Z","submitted_at":"2025-06-09T17:45:18Z","title":"CyberV: Cybernetics for Test-time Scaling in Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:26:46.991810Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.07971"},"observation_digest":"sha256:afe472ff3d0e3b6319c2fc1d8d653e514f62cbfc87bb34318be9027e117ecc8c","observation_id":"b7185dab-cc29-44f0-aed7-77af05663516","resolution":{"observed_at":"2026-08-07T05:26:46.991810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:14:44.256223Z","title":"Ankner, M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.08446","last_updated":"2025-06-10T04:44:28Z","snapshot_observed_at":"2026-08-07T09:15:20.058485Z","submitted_at":"2025-06-10T04:44:28Z","title":"A Survey on Large Language Models for Mathematical Reasoning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T05:14:44.256223Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.08446"},"observation_digest":"sha256:861574aef356b796650948e8ba3340e254e1904a0ece27071a317114e7ef3e90","observation_id":"88600e08-3aad-440a-b8fe-7493dd2e2d5f","resolution":{"observed_at":"2026-08-07T05:14:44.256223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-07T05:03:59.046421Z","title":"arXiv preprint arXiv:2408.11791","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08965","last_updated":"2025-06-10T16:37:13Z","snapshot_observed_at":"2026-08-09T02:27:49.995559Z","submitted_at":"2025-06-10T16:37:13Z","title":"GFRIEND: Generative Few-shot Reward Inference through EfficieNt DPO","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:59.046421Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2506.08965"},"observation_digest":"sha256:d76c639ee9732c866401bbaa4acd5b6ede3159a57e89a0a3cb33c7172c3b2a69","observation_id":"717b82e3-abeb-4939-8f27-cbe14a2d3d99","resolution":{"observed_at":"2026-08-07T05:03:59.046421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-06T21:13:12.739806Z","title":"Chang, and Prithviraj Ammanabrolu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.00711","last_updated":"2025-07-01T12:14:22Z","snapshot_observed_at":"2026-08-07T07:21:03.621965Z","submitted_at":"2025-07-01T12:14:22Z","title":"Large Reasoning Models are not thinking straight: on the unreliability of thinking trajectories","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:13:12.739806Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2507.00711"},"observation_digest":"sha256:80b51b0ba06e4b5f38a30c7aadeaa0ed2091b6cefb191b64c9c01ba684c48edd","observation_id":"54cf2e96-04ce-4fd7-abac-42db1f557aa2","resolution":{"observed_at":"2026-08-06T21:13:12.739806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-06T17:41:41.971957Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10182","last_updated":"2025-07-14T11:44:04Z","snapshot_observed_at":"2026-08-08T23:20:51.475560Z","submitted_at":"2025-07-14T11:44:04Z","title":"Breaking the Myth: Can Small Models Infer Postconditions Too?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T17:41:41.971957Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2507.10182"},"observation_digest":"sha256:d91d7932e7c76d652867ce7740e2dd94abe949bf7a655ea4e6d993588cb3ab27","observation_id":"f312f2fd-44f8-487b-a850-46a7ca56ff50","resolution":{"observed_at":"2026-08-06T17:41:41.971957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-06T15:47:30.588128Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15024","last_updated":"2025-07-20T16:19:51Z","snapshot_observed_at":"2026-08-07T23:16:39.881011Z","submitted_at":"2025-07-20T16:19:51Z","title":"RefCritic: Training Long Chain-of-Thought Critic Models with Refinement Feedback","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T15:47:30.588128Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2507.15024"},"observation_digest":"sha256:bd92477ed37506276b9cadd54322ee5b258cf607e34ea9e32904609bef807f84","observation_id":"6f7414c9-713f-489a-a2f9-ed4b1c21aeac","resolution":{"observed_at":"2026-08-06T15:47:30.588128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2509.08827","last_updated":"2025-10-09T17:08:52Z","snapshot_observed_at":"2026-08-06T15:38:05.011922Z","submitted_at":"2025-09-10T17:59:43Z","title":"A Survey of Reinforcement Learning for Large Reasoning Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-18T00:02:24.352947Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2509.08827"},"observation_digest":"sha256:5ee48b11bfde14d5405242b7d9dcb6f04d4188b90523797d8b9805f14ea7e0b4","observation_id":"1c6ce263-51aa-46b7-9c5f-c73c385aa4e9","resolution":{"observed_at":"2026-05-18T00:02:24.845131Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-03T23:17:37.743021Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:84edc24b1307ae1654695ad088745b802f0ce8b98e97862fccfb4faf5db80a2a","observation_id":"2871b6e8-113e-4917-92d1-70c386faed27","resolution":{"observed_at":"2026-05-18T03:20:49.228790Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-03T03:04:43.039235Z","title":"Critique- out-loud reward models.arXiv preprint arXiv:2408.11791,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.09305","last_updated":"2026-06-28T18:13:37Z","snapshot_observed_at":"2026-08-08T13:06:41.126177Z","submitted_at":"2026-02-10T00:45:24Z","title":"Reward Modeling for Reinforcement Learning-Based LLM Reasoning: Design, Challenges, and Evaluation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T03:04:43.039235Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2602.09305"},"observation_digest":"sha256:a38fd996d9683efb7df8c30110f808537c44aba2219869797efe3128d6e647d0","observation_id":"2fd3859e-1fec-4c0e-ad7c-7d64b65f3511","resolution":{"observed_at":"2026-08-03T03:04:43.039235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2604.13602","last_updated":"2026-04-15T08:11:34Z","snapshot_observed_at":"2026-07-06T23:01:32.542040Z","submitted_at":"2026-04-15T08:11:34Z","title":"Reward Hacking in the Era of Large Models: Mechanisms, Emergent Misalignment, Challenges","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-05-10T13:58:53.430492Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2604.13602"},"observation_digest":"sha256:466ad4d5329593af136abd6651b8d7dfc5c90556ff45042e4f0946857f156215","observation_id":"1b3a7623-2bc3-4be7-863b-fb344aa79ecf","resolution":{"observed_at":"2026-05-10T14:00:28.649424Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2604.20216","last_updated":"2026-04-22T06:05:22Z","snapshot_observed_at":"2026-08-08T15:21:09.813856Z","submitted_at":"2026-04-22T06:05:22Z","title":"Text-to-Distribution Prediction with Quantile Tokens and Neighbor Context","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-10T00:58:34.750132Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2604.20216"},"observation_digest":"sha256:f6f0038d56b3c7287cde48b471abf8249c3e270b7dcd870a9aa5c1cbf48601a7","observation_id":"94806a1e-9d9c-4889-be33-349810620731","resolution":{"observed_at":"2026-05-10T00:59:48.734938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2604.21718","last_updated":"2026-04-26T23:28:29Z","snapshot_observed_at":"2026-08-03T21:12:35.258126Z","submitted_at":"2026-04-22T09:01:04Z","title":"Building a Precise Video Language with Human-AI Oversight","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-10T00:37:31.858728Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2604.21718"},"observation_digest":"sha256:1d58e5b219f1d0c79125161dc7054af850bed062c2931dd5b32b8b913d40cef8","observation_id":"e9eedcf7-ea0e-4e25-a36b-53136ad5baff","resolution":{"observed_at":"2026-05-11T13:46:04.566261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2605.03356","last_updated":"2026-05-05T04:29:38Z","snapshot_observed_at":"2026-08-06T23:24:38.436110Z","submitted_at":"2026-05-05T04:29:38Z","title":"POSTCONDBENCH: Benchmarking Correctness and Completeness in Formal Postcondition Inference","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-07T16:04:48.394294Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2605.03356"},"observation_digest":"sha256:2648dfa8da0c46ce0a2d5ed07eab58758840950875ea0c5dc7de7d91cd67a8bf","observation_id":"c06dd0f4-de11-46f0-b672-6127bd5eda1f","resolution":{"observed_at":"2026-05-11T23:56:12.299635Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2605.08354","last_updated":"2026-05-08T18:05:27Z","snapshot_observed_at":"2026-08-06T15:50:59.788758Z","submitted_at":"2026-05-08T18:05:27Z","title":"Auto-Rubric as Reward: From Implicit Preferences to Explicit Multimodal Generative Criteria","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T00:58:53.626310Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2605.08354"},"observation_digest":"sha256:2689f70cd9c499ee37ba87862c6314a1e8bc6643fa3e1bab028c8352016af94b","observation_id":"3950b2ef-8a37-4881-a12a-ed5e522102e3","resolution":{"observed_at":"2026-05-12T08:36:24.356872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2605.12620","last_updated":"2026-05-12T18:08:24Z","snapshot_observed_at":"2026-08-03T11:10:25.959236Z","submitted_at":"2026-05-12T18:08:24Z","title":"Think Twice, Act Once: Verifier-Guided Action Selection For Embodied Agents","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-14T21:04:05.443622Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2605.12620"},"observation_digest":"sha256:b8272c3dbcb492ee8eeb9a3c5dace0ec5a07ab213ff7280d5625b81e414012fc","observation_id":"167c9dd6-8b63-46e6-9737-97b2558b2275","resolution":{"observed_at":"2026-05-14T21:19:28.896031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2605.14636","last_updated":"2026-05-14T09:49:35Z","snapshot_observed_at":"2026-08-01T15:22:42.391748Z","submitted_at":"2026-05-14T09:49:35Z","title":"Teaching Large Language Models When Not to Know: Learning Temporal Critique for Ex-Ante Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T20:46:31.368628Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2605.14636"},"observation_digest":"sha256:07aac521a64e8509c088e2fa601825f0d16301b7b349c10aaccbb04558fc0f18","observation_id":"b610004c-d2ae-49c4-9b69-3783db5b7733","resolution":{"observed_at":"2026-06-30T20:55:04.641566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2605.18653","last_updated":"2026-05-18T17:00:15Z","snapshot_observed_at":"2026-08-02T07:47:03.226350Z","submitted_at":"2026-05-18T17:00:15Z","title":"Will It Go Viral? Grounding Micro-Video Popularity Prediction on the Open Web","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-20T00:55:59.857014Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2605.18653"},"observation_digest":"sha256:0bd285a77c36929cab3769020ee27149ec0c2fa2c3ca6529b8ac57a257b9e6ea","observation_id":"32b7c71e-b8e2-43cf-9ba2-8038e38c8035","resolution":{"observed_at":"2026-05-20T00:57:54.234885Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2605.18851","last_updated":"2026-05-13T11:04:31Z","snapshot_observed_at":"2026-07-06T23:29:38.069295Z","submitted_at":"2026-05-13T11:04:31Z","title":"STRIDE: Learnable Stepwise Language Feedback for LLM Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-20T20:47:16.236629Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2605.18851"},"observation_digest":"sha256:02a45886b1aeb188119b6ad9870478cc5fa413c282728b150043179e80c9be54","observation_id":"44aa9132-73d4-4734-a09e-d5693b32022d","resolution":{"observed_at":"2026-05-20T20:49:00.763493Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2606.00424","last_updated":"2026-05-29T23:21:48Z","snapshot_observed_at":"2026-08-02T07:23:01.039858Z","submitted_at":"2026-05-29T23:21:48Z","title":"Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T21:55:58.645062Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2606.00424"},"observation_digest":"sha256:db24e02c544044062aacab616c597e492470310677e2dd2cfe9482420f921611","observation_id":"60e72776-fd66-40b5-ad67-d78891cd5a0b","resolution":{"observed_at":"2026-07-01T19:56:11.026051Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":150,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:9aaebd67b2a747f42bccb71a7bf643c9061a4f3ca2d58a57f7e89c8049de2b92","observation_id":"ecdb5959-f451-4728-8209-00316980fc7a","resolution":{"observed_at":"2026-07-01T20:46:14.361106Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":"2408.11791","doi":"10.48550/arxiv.2408.11791","metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Critique-out-loud reward models","venue":"arXiv (Cornell University)","work_id":"adbb5d79-de43-49c4-abd5-ad004e77abea","year":2024},"citing_paper":{"arxiv_id":"2606.08077","last_updated":"2026-06-06T09:55:22Z","snapshot_observed_at":"2026-08-07T20:09:43.219094Z","submitted_at":"2026-06-06T09:55:22Z","title":"Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-27T20:06:12.523067Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2606.08077"},"observation_digest":"sha256:bf9695abd8ddc135fd0bc0d221455eca752c9004c23cdd37f9db8b4f984ecb08","observation_id":"e5fdd755-982f-4f9a-a992-a42aef3bd337","resolution":{"observed_at":"2026-07-02T20:47:23.356231Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-01T16:07:59.714666Z","title":"arXiv preprint arXiv:2408.11791 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18110","last_updated":"2026-07-20T16:08:49Z","snapshot_observed_at":"2026-08-05T10:41:27.894489Z","submitted_at":"2026-07-20T16:08:49Z","title":"LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T16:07:59.714666Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2607.18110"},"observation_digest":"sha256:bfbd0d7686d920e22512d607ee1cf094df48154d826c4de7f3dff03e5f7c58e4","observation_id":"519f152e-7f22-4a9f-8f18-3e4c80e4fed9","resolution":{"observed_at":"2026-08-01T16:07:59.714666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11791","snapshot_observed_at":"2026-08-03T12:09:05.397076Z","title":"arXiv preprint arXiv:2408.11791 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.29185","last_updated":"2026-07-31T09:05:58Z","snapshot_observed_at":"2026-08-07T21:39:04.842591Z","submitted_at":"2026-07-31T09:05:58Z","title":"Learning Latent Reasoning Traces for Scalar Reward Models End-to-End","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T12:09:05.397076Z"},"links":{"cited_paper":"/paper/2408.11791","citing_paper":"/paper/2607.29185"},"observation_digest":"sha256:c3c91e677dedfe087a34821c1c568b927ed77a2992f05c3931d0eda73f4c06e1","observation_id":"485eac96-9550-4488-868a-acade5e44020","resolution":{"observed_at":"2026-08-03T12:09:05.397076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.11791/citation-record","integrity":"/paper/2408.11791/integrity","json":"/paper/2408.11791/citation-record.json","paper":"/paper/2408.11791"},"outbound":[],"paper":{"arxiv_id":"2408.11791","last_updated":"2024-08-21T17:24:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:04:09.389583Z","submitted_at":"2024-08-21T17:24:15Z","title":"Critique-out-Loud Reward Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 35 inbound Pith citation observations for arXiv:2408.11791."}