{"as_of":"2026-08-06T03:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92b1f0a3b1f54340fb66f4f47b14cf6da60e567726e7bac4d5644dd1cb68fe2a","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":49,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:59:52.020948Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-16T06:58:36.684583Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2406.08464"},"observation_digest":"sha256:858cc9307d45e1e4a0525a8625ed973748bc0fee864f0907ac7a6fc29f66e6f2","observation_id":"4837305e-d645-41f6-abde-f621aa5cc087","resolution":{"observed_at":"2026-05-16T06:58:36.864176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2410.18451","last_updated":"2024-10-24T06:06:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-24T06:06:26Z","title":"Skywork-Reward: Bag of Tricks for Reward Modeling in LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T16:18:01.560780Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2410.18451"},"observation_digest":"sha256:88becd3f771b17c156c2a17dc3f37c785a32492a6cc379dec22937a71f7f14ae","observation_id":"f60d7cd4-f05a-43a8-bbe0-7b35578a78e3","resolution":{"observed_at":"2026-05-17T16:18:01.640159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:ab8d3ced3697cef0a237b3fd117338a3cf037cb7e326ab9d6b971bd516f69aa2","observation_id":"be6c4a43-db3f-4f82-a220-d8163efb1b52","resolution":{"observed_at":"2026-05-11T23:08:37.061394Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T06:25:00.376073Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2412.15115"},"observation_digest":"sha256:e0fc88feb789539d734488c806082ffbc7f8f2d57bd9db62d631b6309387655f","observation_id":"936ed788-f2ff-4077-8299-61906f93abfb","resolution":{"observed_at":"2026-05-23T06:25:27.895174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2501.13918","last_updated":"2025-10-27T08:22:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-23T18:55:41Z","title":"Improving Video Generation with Human Feedback","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T15:30:02.578430Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2501.13918"},"observation_digest":"sha256:0e57ce94833104c6d499906f632a1bc0398756941a4205ba8bd7675267c72e33","observation_id":"c045ae24-dc61-44d1-badd-76157314aa2a","resolution":{"observed_at":"2026-05-13T15:30:02.708122Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2506.01937","last_updated":"2026-04-23T14:42:19Z","snapshot_observed_at":"2026-07-06T21:35:12.872021Z","submitted_at":"2025-06-02T17:54:04Z","title":"RewardBench 2: Advancing Reward Model Evaluation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-19T11:18:03.965711Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2506.01937"},"observation_digest":"sha256:56b15d8a2869dc0d688a21c56ff0234804ad8dc3916a05721bf45b5748a51b36","observation_id":"e7d46cc0-4d97-4312-9f6c-32857585d627","resolution":{"observed_at":"2026-05-19T11:22:16.836111Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2506.12382","last_updated":"2026-04-27T08:32:16Z","snapshot_observed_at":"2026-08-02T04:53:57.144183Z","submitted_at":"2025-06-14T07:31:52Z","title":"Exploring the Secondary Risks of Large Language Models","version":5},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-19T09:40:58.067398Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2506.12382"},"observation_digest":"sha256:1241ecd48adbbf8e1d862b6d6a2b7a2e54bdb84e2e8eb290c9129e21e5e653fe","observation_id":"7a841bc7-63da-41a7-ba87-bb019948e034","resolution":{"observed_at":"2026-05-19T09:42:13.993428Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2506.16791","last_updated":"2025-11-03T18:47:03Z","snapshot_observed_at":"2026-07-06T21:45:06.566500Z","submitted_at":"2025-06-20T07:14:48Z","title":"TabArena: A Living Benchmark for Machine Learning on Tabular Data","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-19T08:41:35.789878Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2506.16791"},"observation_digest":"sha256:3ad6dcf5bd05940d24c7d743273ba42b52a565ac4ebc3c12954844d8e181fc5b","observation_id":"6ecefc4e-1d42-41d6-8b40-73afba4c166b","resolution":{"observed_at":"2026-05-19T08:42:12.655284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-06T00:59:52.020948Z","title":"Y.; Chandu, K.; Dziri, N.; Kumar, S.; Zick, T.; Choi, Y.; et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.04088","last_updated":"2025-08-07T03:52:48Z","snapshot_observed_at":"2026-08-06T00:59:47.829408Z","submitted_at":"2025-08-06T05:10:29Z","title":"GM-PRM: A Generative Multimodal Process Reward Model for Multimodal Mathematical Reasoning","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T00:59:52.020948Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.04088"},"observation_digest":"sha256:40da167f8d11a9bb5401db8557a5bef0af1500bd870f979c7524db6ec8fc40e4","observation_id":"e6f20187-9443-46db-943d-9a19b33c66a4","resolution":{"observed_at":"2026-08-06T00:59:52.020948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2508.04149","last_updated":"2026-05-16T09:55:19Z","snapshot_observed_at":"2026-07-06T22:08:36.543090Z","submitted_at":"2025-08-06T07:24:14Z","title":"Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-21T23:46:24.208438Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.04149"},"observation_digest":"sha256:ce662de3a5aa3f6afbc455042cc84911c5240c4f8c6a386c1bc65d58ede6da55","observation_id":"02e09a74-85eb-419c-b489-28852c0dc2f3","resolution":{"observed_at":"2026-05-21T23:50:47.617954Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T19:52:50.233278Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11616","last_updated":"2025-08-15T17:29:06Z","snapshot_observed_at":"2026-08-05T19:52:49.412846Z","submitted_at":"2025-08-15T17:29:06Z","title":"Controlling Multimodal LLMs via Reward-guided Decoding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T19:52:50.233278Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.11616"},"observation_digest":"sha256:bbe8a97331f829bed6003b3810ec3161a4f3c6b9184bcf21267dccf945396973","observation_id":"b3ec0fdf-f59d-440d-9450-2477156f23d6","resolution":{"observed_at":"2026-08-05T19:52:50.233278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T16:32:54.405593Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18255","last_updated":"2025-09-02T17:12:12Z","snapshot_observed_at":"2026-08-05T16:32:51.675767Z","submitted_at":"2025-08-25T17:45:06Z","title":"Hermes 4 Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:32:54.405593Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.18255"},"observation_digest":"sha256:0c95101272b3e81e6a8e60aab9999d9e3b61d1b82e2cb9493251b9e1d70bb4eb","observation_id":"fe8d6d21-146a-42de-9908-d1c58720b217","resolution":{"observed_at":"2026-08-05T16:32:54.405593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T15:44:38.975171Z","title":"arXiv preprint (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19567","last_updated":"2025-08-27T04:54:33Z","snapshot_observed_at":"2026-08-05T15:44:37.897370Z","submitted_at":"2025-08-27T04:54:33Z","title":"Counterfactual Reward Model Training for Bias Mitigation in Multimodal Reinforcement Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T15:44:38.975171Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.19567"},"observation_digest":"sha256:6c750e44a71e6c00460d7cfc47e1ad3fd7febd610acf29e7091c98682a8dcd79","observation_id":"4b4df1d4-e9d8-435f-ae1b-2cbf8d1d07bf","resolution":{"observed_at":"2026-08-05T15:44:38.975171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T15:25:35.346495Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.19922","last_updated":"2025-08-27T14:30:08Z","snapshot_observed_at":"2026-08-05T15:25:32.082540Z","submitted_at":"2025-08-27T14:30:08Z","title":"HEAL: A Hypothesis-Based Preference-Aware Analysis Framework","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:35.346495Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2508.19922"},"observation_digest":"sha256:58cb427ca4aec294c329daa9961386e6884c2cda040215d78e09c945f98510d4","observation_id":"cf22cafc-b38e-42bd-a6d0-9e4780abe1ed","resolution":{"observed_at":"2026-08-05T15:25:35.346495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2509.11206","last_updated":"2026-04-20T05:43:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-14T10:24:13Z","title":"Evalet: Evaluating Large Language Models through Functional Fragmentation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T16:57:25.259866Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2509.11206"},"observation_digest":"sha256:8d166ebccdb66e2ca345f8a673ec357747b24098f3ab692167a91a524f6ba88c","observation_id":"a3727717-6844-4be7-9d66-1c15b74f0283","resolution":{"observed_at":"2026-05-18T17:01:40.069981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-04T14:52:20.583374Z","title":"Lambert, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-04T14:52:17.678718Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.583374Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:6da257c8814e0ceeb56c9868a1823b35b21afaca3904eb1c6c28ee8d926e8546","observation_id":"1e925bf3-af47-4214-bfe5-5b02f232054a","resolution":{"observed_at":"2026-08-04T14:52:20.583374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2510.04225","last_updated":"2026-04-21T18:16:55Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T14:29:01Z","title":"Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T10:13:08.112072Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2510.04225"},"observation_digest":"sha256:55d74ce68d64344b58638af342b27fb88a55c3de4f157eed0e073b7b020c453c","observation_id":"45ff3ac9-20ca-4966-b64f-d54c27368c1f","resolution":{"observed_at":"2026-05-18T10:16:14.370848Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2510.24235","last_updated":"2026-04-20T06:29:42Z","snapshot_observed_at":"2026-08-03T23:17:37.743021Z","submitted_at":"2025-10-28T09:43:47Z","title":"PaTaRM: Bridging Pairwise and Pointwise Signals via Preference-Aware Task-Adaptive Reward Modeling","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T03:15:57.744706Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2510.24235"},"observation_digest":"sha256:417b146afc86b8d1e4f74b47177b4b1d0350c131fc37df197c0eb3a98f4b3ed0","observation_id":"2ec61eb6-808a-4173-9cb2-004f4a719cde","resolution":{"observed_at":"2026-05-18T03:20:49.320809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-04T07:43:24.665067Z","title":"Rewardbench: Evaluating reward models for language modeling.arXiv preprint arXiv:2403.13787,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.24636","last_updated":"2026-07-01T11:59:43Z","snapshot_observed_at":"2026-08-04T07:43:22.493487Z","submitted_at":"2025-10-28T17:02:46Z","title":"OpenReward: Learning to Reward Long-form Agentic Tasks via Reinforcement Learning","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T07:43:24.665067Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2510.24636"},"observation_digest":"sha256:98c07febff4ac63b4d1b01815634987ad3bf7d75431f90de79ee445d4502881c","observation_id":"bb48b874-e55b-4f2c-8572-c3f6a9ed6cb4","resolution":{"observed_at":"2026-08-04T07:43:24.665067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2511.16624","last_updated":"2025-11-20T18:31:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-20T18:31:46Z","title":"SAM 3D: 3Dfy Anything in Images","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-11T11:47:11.554134Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2511.16624"},"observation_digest":"sha256:0db56591dfb551f8c373b873686d1a1e2bc0cf9f24cf3659912a588353294458","observation_id":"7edbe698-b7a3-458e-9e3d-ec620a6efa60","resolution":{"observed_at":"2026-05-11T11:47:13.371686Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-03T08:15:22.075845Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.17717","last_updated":"2026-06-09T20:25:14Z","snapshot_observed_at":"2026-08-03T08:15:07.553014Z","submitted_at":"2026-01-25T06:40:25Z","title":"A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data","version":3},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-08-03T08:15:22.075845Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2601.17717"},"observation_digest":"sha256:96f5e6d50ee07686593f01af28dee5a54199251d9b30187e30660bf47f486b7e","observation_id":"fb3c57c4-7e89-44c6-8440-31393d531545","resolution":{"observed_at":"2026-08-03T08:15:22.075845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-02T18:14:50.265339Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.14473","last_updated":"2026-07-15T10:22:14Z","snapshot_observed_at":"2026-08-05T20:09:51.962104Z","submitted_at":"2026-03-15T16:31:51Z","title":"AI Can Learn Scientific Taste","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T18:14:50.265339Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2603.14473"},"observation_digest":"sha256:c785974f946637981ab8d55508f3162999969bd04d306b23b7fb69419889d63d","observation_id":"ad7b4d95-86db-494a-8959-c9d62fcc80f7","resolution":{"observed_at":"2026-08-02T18:14:50.265339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2604.12312","last_updated":"2026-04-14T05:42:41Z","snapshot_observed_at":"2026-08-02T05:56:57.097541Z","submitted_at":"2026-04-14T05:42:41Z","title":"CompliBench: Benchmarking LLM Judges for Compliance Violation Detection in Dialogue Systems","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:00.449776Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2604.12312"},"observation_digest":"sha256:74106ea29da1fba93a498db2ab994334e181a69f63c531093dcb8797530c0151","observation_id":"9e046eb5-bcad-4b7c-a6db-61232767e668","resolution":{"observed_at":"2026-05-11T11:26:02.367040Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2604.19457","last_updated":"2026-04-21T13:37:19Z","snapshot_observed_at":"2026-08-03T03:36:09.650040Z","submitted_at":"2026-04-21T13:37:19Z","title":"Four-Axis Decision Alignment for Long-Horizon Enterprise AI Agents","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-10T02:19:57.341402Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2604.19457"},"observation_digest":"sha256:11fbd78e0125cd3fcbd2a79c4ad50447856f042babde0f65ef6d5ad9d9760d27","observation_id":"79d4d7a1-b5a7-4336-ad5c-715649dda6db","resolution":{"observed_at":"2026-05-11T13:06:05.342606Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2604.21223","last_updated":"2026-04-23T02:37:34Z","snapshot_observed_at":"2026-07-06T23:07:51.979267Z","submitted_at":"2026-04-23T02:37:34Z","title":"Zero-Shot Detection of LLM-Generated Text via Implicit Reward Model","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-09T22:29:53.202779Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2604.21223"},"observation_digest":"sha256:9292ed7f2b50b8ca991856caeee70962220e0286b06421702748f1582b1fcade","observation_id":"ed37f525-9e2d-4ef8-9279-cf37a138580b","resolution":{"observed_at":"2026-05-09T22:34:07.161906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2604.23178","last_updated":"2026-06-24T13:27:28Z","snapshot_observed_at":"2026-08-05T10:28:56.284877Z","submitted_at":"2026-04-25T07:18:30Z","title":"Judging the Judges: A Systematic Evaluation of Bias Mitigation Strategies in LLM-as-a-Judge Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T08:14:18.535385Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2604.23178"},"observation_digest":"sha256:dcb3cf8cb9d8ca114b59bbf235eeb6ccd97a19244f6d946e1a90c44d1d839d05","observation_id":"fb242eb0-85d6-4c4d-ab0b-1890bbbbcbea","resolution":{"observed_at":"2026-05-11T20:41:14.089601Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:22.162163Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:b774a6c98352fac8688446741994334cee0f0d616527f3491681a0ca7f0bbe8a","observation_id":"b2bcb6ca-2584-4584-beb6-d2a9e5679d51","resolution":{"observed_at":"2026-05-09T06:00:35.104015Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:46.725354Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:3b0aa7c386a5f16b1ba190f751da3e1fa2e3f7fef249c748f81553f1217f2e2e","observation_id":"15ae18c7-113b-450f-b49e-deaa22192fbb","resolution":{"observed_at":"2026-05-11T03:50:57.990159Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.04454","last_updated":"2026-05-06T03:28:30Z","snapshot_observed_at":"2026-08-04T06:38:56.344758Z","submitted_at":"2026-05-06T03:28:30Z","title":"Deployment-Relevant Alignment Cannot Be Inferred from Model-Level Evaluation Alone","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T18:11:42.971428Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.04454"},"observation_digest":"sha256:adbbf2bf3d90bb7253da80c1422a3bf7152831e2248cd09070c54167a658158b","observation_id":"e458652d-1cae-4cf4-ac8c-a05762a10c21","resolution":{"observed_at":"2026-05-09T06:40:43.244784Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.16339","last_updated":"2026-05-07T16:48:48Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-07T16:48:48Z","title":"Preference Instability in Reward Models: Detection and Mitigation via Sparse Autoencoders","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-20T22:48:54.238767Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.16339"},"observation_digest":"sha256:5955f8a6e62ec0b5a0d7cf0602ff5fc11faacb5b82df054b8aec19f4749b6ca2","observation_id":"f3255c4e-82e1-4cae-b4c5-c13fa899701c","resolution":{"observed_at":"2026-05-20T22:49:10.154459Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.20164","last_updated":"2026-05-19T17:50:18Z","snapshot_observed_at":"2026-07-06T23:30:49.211483Z","submitted_at":"2026-05-19T17:50:18Z","title":"Not Every Rubric Teaches Equally: Policy-Aware Rubric Rewards for RLVR","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-20T05:02:35.271960Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.20164"},"observation_digest":"sha256:fe956072825891bccd0fd376fac158a26ff27db6958815cd7fe40fd209fd6259","observation_id":"fc8c028b-4999-46e6-98cb-c0ec40f0b283","resolution":{"observed_at":"2026-05-20T05:03:03.609176Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.30758","last_updated":"2026-05-29T02:41:18Z","snapshot_observed_at":"2026-08-03T06:24:52.704941Z","submitted_at":"2026-05-29T02:41:18Z","title":"Pairwise Reference Alignment as a Model-Level Ordinal Observable","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T22:46:11.450812Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.30758"},"observation_digest":"sha256:b91fd4922e63157ef3061a2fc57803d8b5e80da6451a955c4308e6a36e6c71d0","observation_id":"54af2848-6ec6-4303-abc2-74d4261a815c","resolution":{"observed_at":"2026-07-01T19:25:59.706899Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2605.30803","last_updated":"2026-05-29T03:45:11Z","snapshot_observed_at":"2026-08-05T08:11:57.090688Z","submitted_at":"2026-05-29T03:45:11Z","title":"PReMISE: Policy Rubrics as Measurement Specifications for LLM Judges","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T22:33:05.343496Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2605.30803"},"observation_digest":"sha256:2aa2981c550e32bba9ce22f6e9f3ea001ab002d67374610bc07218730a0583d2","observation_id":"8f55d6e4-a7a1-4529-8c44-ed14ca1e86b8","resolution":{"observed_at":"2026-07-01T19:26:00.796432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2606.00437","last_updated":"2026-05-30T00:05:14Z","snapshot_observed_at":"2026-07-06T23:41:10.825760Z","submitted_at":"2026-05-30T00:05:14Z","title":"EST-PRM: Stress-Testing Process Reward Models Before They Become Load-Bearing","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-28T19:18:55.398976Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2606.00437"},"observation_digest":"sha256:5ca6bed46017c07947b8cf4b67c103783f9e14b80b7105b946429654d0bd2d74","observation_id":"363a698c-d10d-4f83-a758-774e45d93061","resolution":{"observed_at":"2026-06-28T19:22:34.486732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2606.01034","last_updated":"2026-05-31T05:50:27Z","snapshot_observed_at":"2026-08-04T18:54:04.912017Z","submitted_at":"2026-05-31T05:50:27Z","title":"A Finite-Calibration Regime Map for LLM Judge Panels","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:34:28.258222Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2606.01034"},"observation_digest":"sha256:6c516144d22c1ae432304f02a7c5db6781ce3e8857a1fef8259f537c753edcfd","observation_id":"add9a932-09bc-4dfd-9171-9ca2dde3b2a5","resolution":{"observed_at":"2026-07-01T21:06:13.126347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2606.09711","last_updated":"2026-06-08T16:32:54Z","snapshot_observed_at":"2026-07-06T23:49:03.237958Z","submitted_at":"2026-06-08T16:32:54Z","title":"Proxy Reward Internalization and Mechanistic Exploitation: A Learned Precursor to Reward Hacking and Its Generalization","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-06-27T16:26:34.918099Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2606.09711"},"observation_digest":"sha256:f95be4f04e49c29b1977a0d3610e9b6a49546f40388a789eb9fa03902a208731","observation_id":"288c43ac-8ee4-4bce-89b5-c9943aeebd86","resolution":{"observed_at":"2026-07-03T01:37:30.532714Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2606.21296","last_updated":"2026-06-19T10:19:54Z","snapshot_observed_at":"2026-08-02T18:19:53.372016Z","submitted_at":"2026-06-19T10:19:54Z","title":"Discriminatory Compliance: How LLMs Answer Queries from Protected Groups","version":1},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-06-26T12:58:09.227648Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2606.21296"},"observation_digest":"sha256:8089fcfdf82e14ad7b034a44e1e2b0f0558798afc15cbd50736cf073e4092d98","observation_id":"074aa224-c373-46aa-ae16-23f30a1aab78","resolution":{"observed_at":"2026-06-26T12:59:29.168628Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2606.31748","last_updated":"2026-06-30T14:38:49Z","snapshot_observed_at":"2026-07-07T00:05:27.130060Z","submitted_at":"2026-06-30T14:38:49Z","title":"Addressing Over-Refusal in LLMs with Competing Rewards","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-07-01T06:59:12.695984Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2606.31748"},"observation_digest":"sha256:24dd7ae28401f1190e14e95c66a3bea8043b8e92196be59f22c4d449c8338502","observation_id":"29dd4dd1-dfcd-457f-a273-5deadf5ffba2","resolution":{"observed_at":"2026-07-01T08:55:35.489468Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2606.32034","last_updated":"2026-06-30T17:58:23Z","snapshot_observed_at":"2026-07-07T00:05:41.920778Z","submitted_at":"2026-06-30T17:58:23Z","title":"QVal: Cheaply Evaluating Dense Supervision Signals for Long-Horizon LLM Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T05:59:13.631078Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2606.32034"},"observation_digest":"sha256:7678378b1b5f9763db944b27d2838477ffb707e93d12883c5949b09e7e47cf0a","observation_id":"157aae37-3740-48b6-9780-a27d40860516","resolution":{"observed_at":"2026-07-01T06:05:28.936347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2403.13787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":143,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:d6dc3f9a50f809228998faacf667fd97dfad20f73960983910ef63f04a31a7d6","observation_id":"50d8a596-f9d8-4d93-b405-c6eefd3e9c9d","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-02T08:40:48.152223Z","title":"arXiv preprint arXiv:2403.13787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":144,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:48.152223Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:faee3b87fdfacfaca686aeddfb4ea9a97be3c93819f5970688fc2a15112ae724","observation_id":"4d5d7f8e-46e4-4991-8960-a65454de3acb","resolution":{"observed_at":"2026-08-02T08:40:48.152223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":"2403.13787","doi":"10.48550/arxiv.2403.13787","metadata_source":"pith","pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, and Hanna Hajishirzi","venue":"cs.LG","work_id":"ff1fdc14-8407-4029-a1e6-ce4921d8d7ae","year":2024},"citing_paper":{"arxiv_id":"2607.08535","last_updated":"2026-07-09T14:31:05Z","snapshot_observed_at":"2026-08-03T11:44:06.153926Z","submitted_at":"2026-07-09T14:31:05Z","title":"When the Judge Changes, So Does the Measurement: Auditing LLM-as-Judge Reliability","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T05:47:32.670216Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.08535"},"observation_digest":"sha256:0d93868254295b29d0a49bffcaaac9ee106bf6358aa070b3d77aa24705c8545d","observation_id":"46da7b85-3aed-42ef-a3a3-0aba1766dafe","resolution":{"observed_at":"2026-07-10T05:56:50.525489Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-07-14T07:59:56.441098Z","title":"arXiv preprint arXiv:2403.13787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.10966","last_updated":"2026-07-13T00:21:30Z","snapshot_observed_at":"2026-08-04T00:19:49.524589Z","submitted_at":"2026-07-13T00:21:30Z","title":"SVR-R1: Bootstrapping Multi-modal Reasoning with Self-verification in Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-14T07:59:56.441098Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.10966"},"observation_digest":"sha256:3757eb1f42638400d16b6a9bd1481fca7588b0dd0952ced201f8e61b24586a4d","observation_id":"96b1c4e1-4c5b-43a2-a34c-d67a402cb7ea","resolution":{"observed_at":"2026-07-14T07:59:56.441098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-07-14T02:33:34.084111Z","title":"and Hajishirzi, Hannaneh , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11871","last_updated":"2026-07-13T17:55:19Z","snapshot_observed_at":"2026-08-05T16:49:44.432361Z","submitted_at":"2026-07-13T17:55:19Z","title":"Inside the Unfair Judge: A Mechanistic Interpretability Account of LLM-as-Judge Bias","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-14T02:33:34.084111Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.11871"},"observation_digest":"sha256:1111d2bbac05cbef1b48689a06f320405c2af0e78da72829545d4d4ca1a9d744","observation_id":"32b72cbd-74b6-441e-9202-a0963abf23a3","resolution":{"observed_at":"2026-07-14T02:33:34.084111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-01T15:08:37.823880Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18553","last_updated":"2026-07-28T16:28:19Z","snapshot_observed_at":"2026-08-05T12:20:24.713228Z","submitted_at":"2026-07-20T22:40:36Z","title":"Operational Proto-Introspection in Looped Language Models: Process-Quality Taps, Executable Branching, and the Readout-Control Boundary","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T15:08:37.823880Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.18553"},"observation_digest":"sha256:e907ae00d076570b2a9de6c33af370d110279414305a126ae5976ec86e644ac5","observation_id":"2ee9dde9-c887-4ede-b44e-8cfc9300ca8b","resolution":{"observed_at":"2026-08-01T15:08:37.823880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-02T07:46:11.984755Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20527","last_updated":"2026-07-10T02:05:17Z","snapshot_observed_at":"2026-08-05T14:04:45.512105Z","submitted_at":"2026-07-10T02:05:17Z","title":"Evaluating and Guarding Citation Faithfulness in Agentic Scientific Synthesis","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T07:46:11.984755Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.20527"},"observation_digest":"sha256:1dcd3f6076bd9f3c3db7aa9276976286041c8845b937737c80825afca062a84c","observation_id":"41b013a8-943d-46c9-b0db-4fe04a4b6371","resolution":{"observed_at":"2026-08-02T07:46:11.984755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-01T07:28:29.938151Z","title":"arXiv preprint arXiv:2403.13787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:29.938151Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:936b55ccda3f4a985d2826cc3059cd2e8c0615b391b9fbce8524577cc5ab940c","observation_id":"2f1d217c-8280-4bb1-8336-802bfeaecb64","resolution":{"observed_at":"2026-08-01T07:28:29.938151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-01T03:14:11.464266Z","title":"arXiv:2403.13787","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:11.464266Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:6751c36c85a0365c003c04517cf3b1ef91133a117cd60047ada95a18c1bcf807","observation_id":"d10d2cd2-a4c2-4cb7-88a7-3f85aa373f0c","resolution":{"observed_at":"2026-08-01T03:14:11.464266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-03T00:55:25.686463Z","title":"arXiv preprint arXiv:2403.13787 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28636","last_updated":"2026-05-19T13:56:13Z","snapshot_observed_at":"2026-08-06T00:38:04.006327Z","submitted_at":"2026-05-19T13:56:13Z","title":"Chain-of-Models: Cross-Model Auditing for Bias-Robust LLM Judges","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T00:55:25.686463Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2607.28636"},"observation_digest":"sha256:8402f8a1bf22b9a77499100c64d35be6c752f51160b7e9073d9e5910d70f39cc","observation_id":"6d6e2847-5870-4ffc-acac-8822098b0191","resolution":{"observed_at":"2026-08-03T00:55:25.686463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2403.13787/citation-record","integrity":"/paper/2403.13787/integrity","json":"/paper/2403.13787/citation-record.json","paper":"/paper/2403.13787"},"outbound":[],"paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 49 inbound Pith citation observations for arXiv:2403.13787."}