{"as_of":"2026-08-06T05:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e266a2320f3c9f7ecc78b439aad51cab8110f564431b01add27a5deea42d1d92","coverage":[{"denominator":104,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T12:01:42.290502Z","state":"measured"},{"denominator":187,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":187,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":87,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":87,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:42:59.909123Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":9,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-14T23:00:20.720030Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2401.01335"},"observation_digest":"sha256:b7cde01a1401924454d777c12ad0ce6355d21915479d104d8fd2b2bfd470e733","observation_id":"0ddbc15f-8636-45db-8b9e-b53b88bcc368","resolution":{"observed_at":"2026-05-14T23:00:21.250918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-12T12:17:53.478052Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2402.01306"},"observation_digest":"sha256:8e0f123612f3cfab16ae668efa02241188896b298d34f57c89fe95dadc90ead8","observation_id":"b498cc2c-6bf4-4fc5-ad15-a9f91c662656","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-11T12:40:02.129674Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2403.13372"},"observation_digest":"sha256:74814384eba4773ace90cb3416dc8c7916476964b80082103b4b8aa90c8fa90b","observation_id":"93501320-7e32-4ca5-885f-c7d18ed1bd81","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2406.07496","last_updated":"2024-06-11T17:32:21Z","snapshot_observed_at":"2026-07-06T18:29:04.294349Z","submitted_at":"2024-06-11T17:32:21Z","title":"TextGrad: Automatic \"Differentiation\" via Text","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T11:27:58.098484Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2406.07496"},"observation_digest":"sha256:3091445832d6c5bd4e4ced2af2835fd3e1d0bd22d93aeffe1393cc769e611605","observation_id":"a1388664-2fa5-4511-bca0-c965b7fa8165","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-02T15:25:02.551919Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-13T04:36:45.363131Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2406.17557"},"observation_digest":"sha256:2a73b863cc912b48128b4b1aefdbcfd67befd14aba34baf3896243acfe1772e9","observation_id":"759d9ff3-ec21-4452-9a23-6c63f6773f81","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2408.15339","last_updated":"2026-05-07T20:32:48Z","snapshot_observed_at":"2026-08-02T15:53:33.114051Z","submitted_at":"2024-08-27T18:04:07Z","title":"UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T21:22:36.970101Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2408.15339"},"observation_digest":"sha256:b7729d328d52fc539955859fcf13faa5256a6bceff6b8cee9ea5f6931d6b194d","observation_id":"d7d6c5fd-dc09-4622-953b-957c1f47e449","resolution":{"observed_at":"2026-05-23T21:23:27.377474Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"reference_index":199,"source":"pdf_text","source_observed_at":"2026-05-23T17:33:13.394338Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2411.15594"},"observation_digest":"sha256:303e1051db1cb1a6d9dea1832ae20e617fba401542c90efd051c44d3cb919d9b","observation_id":"43567dc9-29ee-4850-a561-374a6966c29b","resolution":{"observed_at":"2026-05-23T17:35:43.863879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2412.05579","last_updated":"2024-12-10T05:49:12Z","snapshot_observed_at":"2026-07-31T01:42:39.468673Z","submitted_at":"2024-12-07T08:07:24Z","title":"LLMs-as-Judges: A Comprehensive Survey on LLM-based Evaluation Methods","version":2},"reference_index":285,"source":"pdf_text","source_observed_at":"2026-05-11T23:08:34.312466Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2412.05579"},"observation_digest":"sha256:ed268e393ca5433afb897eba3e47acac3d35554089a67d360cb17889049ba68a","observation_id":"985a03ac-cbb1-4116-aff7-6d47da53886b","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-06T04:32:48.263657Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":285,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:6bb083da4ba65b4cecec3b23a1e3c659ff8c93bf08bd505043a9b3ff311a9d55","observation_id":"31843f9f-dd1b-4618-a10b-18ab76d89998","resolution":{"observed_at":"2026-05-22T19:32:01.174402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":195,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:d84c3511b912e0fb9f9f9534e6f2307c105727dfac169951772ccc682c5453a2","observation_id":"632c9860-33a5-4e8f-b341-5a12f7ac8a02","resolution":{"observed_at":"2026-05-14T22:23:15.031489Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T23:06:49.712423Z","title":"Y.; Cho , K.; Li , X.; Sukhbaatar , S.; Xu , J.; and Weston , J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.06026","last_updated":"2025-08-08T05:25:54Z","snapshot_observed_at":"2026-08-05T23:06:47.763233Z","submitted_at":"2025-08-08T05:25:54Z","title":"Temporal Self-Rewarding Language Models: Decoupling Chosen-Rejected via Past-Future","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T23:06:49.712423Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2508.06026"},"observation_digest":"sha256:a0abf2a0215aac285a966a3130630a511070391cca9178f02a52cbf8d54a81a1","observation_id":"596f078d-45fb-46bf-a7ad-bcc89012defb","resolution":{"observed_at":"2026-08-05T23:06:49.712423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2508.19652","last_updated":"2026-04-27T16:28:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-27T08:01:03Z","title":"Self-Rewarding Vision-Language Model via Reasoning Decomposition","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T21:03:31.606674Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2508.19652"},"observation_digest":"sha256:8961d52aa30a0ccd2249141801273038eb7c3636e7060a89861db8dcaf676c1b","observation_id":"b58b8565-ac9d-418f-baf7-a7c69adfc8d5","resolution":{"observed_at":"2026-05-18T21:06:50.919220Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T15:00:53.736544Z","title":"Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, and Hai Li","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20655","last_updated":"2025-09-11T12:03:20Z","snapshot_observed_at":"2026-08-05T15:00:52.270796Z","submitted_at":"2025-08-28T11:01:33Z","title":"Improving Alignment in LVLMs with Debiased Self-Judgment","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:00:53.736544Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2508.20655"},"observation_digest":"sha256:ed5dfddfa1062951bb1313f81e38fe78b9c167435f3ceba03e74fdbf6e1f07a2","observation_id":"6202109f-f96a-4bf0-a89b-444b0fda9ba0","resolution":{"observed_at":"2026-08-05T15:00:53.736544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T14:22:39.209835Z","title":"Adversarial Reward Sig- nal Optimization with Reflection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.21476","last_updated":"2025-08-29T10:00:55Z","snapshot_observed_at":"2026-08-05T18:04:11.901417Z","submitted_at":"2025-08-29T10:00:55Z","title":"Igniting Creative Writing in Small Language Models: LLM-as-a-Judge versus Multi-Agent Refined Rewards","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:22:39.209835Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2508.21476"},"observation_digest":"sha256:e3a23b096ec81f7de5f24641349db4f3263e0fb44c8eeb6316d3bde7bf8589f1","observation_id":"8f6d1485-5ea9-4e63-8b1f-def683ab6f0a","resolution":{"observed_at":"2026-08-05T14:22:39.209835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T12:27:27.690602Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01610","last_updated":"2025-09-01T16:43:48Z","snapshot_observed_at":"2026-08-06T04:32:51.830706Z","submitted_at":"2025-09-01T16:43:48Z","title":"Improving Large Vision and Language Models by Learning from a Panel of Peers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-05T12:27:27.690602Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2509.01610"},"observation_digest":"sha256:a8514f06384b5574f7edd86baf68bc61affb771720e07a02b40465d583004dd9","observation_id":"46ff7d88-df70-4e82-ba8b-5a1480e5df3a","resolution":{"observed_at":"2026-08-05T12:27:27.690602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2509.03403","last_updated":"2026-05-15T21:29:46Z","snapshot_observed_at":"2026-07-06T22:23:00.681940Z","submitted_at":"2025-09-03T15:28:51Z","title":"Beyond Correctness: Harmonizing Process and Outcome Rewards through RL Training","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-21T22:38:57.833414Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2509.03403"},"observation_digest":"sha256:3a964e8485d873b5ec3fdeb9a20e03cea30de852f3bbb4d5d724b582273bde7a","observation_id":"457351ee-529c-446f-86c1-9bac5eb10b8b","resolution":{"observed_at":"2026-05-21T22:40:43.185228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-07-06T22:23:05.533901Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:7ca567fce35c9062a7ba62fb9ad116319bfdb23477fa50c576d62cf51c516895","observation_id":"5f0889fe-3ffc-4605-8f3c-129dde1d2f9e","resolution":{"observed_at":"2026-05-21T22:24:23.537377Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2509.23542","last_updated":"2026-04-19T04:59:30Z","snapshot_observed_at":"2026-08-03T18:10:00.237919Z","submitted_at":"2025-09-28T00:43:52Z","title":"On the Shelf Life of Fine-Tuned LLM-Judges: Future-Proofing, Backward-Compatibility, and Question Generalization","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-18T12:53:45.767341Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2509.23542"},"observation_digest":"sha256:2e37e953329ca80b7571397804bd4aaad7e65e4dbdb42c2b690ca7fb5d109d3c","observation_id":"9072b3cc-72b5-4a2d-8b39-6bfc30a446b7","resolution":{"observed_at":"2026-05-18T12:56:24.592720Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-04T10:44:31.957359Z","title":"Self-rewarding language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.08977","last_updated":"2026-06-02T08:25:17Z","snapshot_observed_at":"2026-08-04T10:44:27.363839Z","submitted_at":"2025-10-10T03:38:17Z","title":"Breaking the Self-Confirming Loop: Diagnosing and Mitigating Systemic Reward Bias in Self-Rewarding RL","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T10:44:31.957359Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2510.08977"},"observation_digest":"sha256:b8dc458c5b12a42db54ee54b29e37c5dd60bc92c7ceaec6bb12fe9843295c584","observation_id":"0c669d5e-9341-4ae3-9449-1814176dc4a3","resolution":{"observed_at":"2026-08-04T10:44:31.957359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-03T16:43:57.799392Z","title":"Yue, X., Zheng, T., Zhang, G., and Chen, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.12576","last_updated":"2026-05-23T02:48:11Z","snapshot_observed_at":"2026-08-03T16:43:53.189781Z","submitted_at":"2025-12-14T07:03:51Z","title":"Coupled Variational Reinforcement Learning for Language Model General Reasoning","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T16:43:57.799392Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2512.12576"},"observation_digest":"sha256:0253b4e7596cf7cca46812b4fe5aee1e224fde03d92c9d58b0a95aa742f256bd","observation_id":"6b66f49f-04bf-4706-aedb-d3cab0e19629","resolution":{"observed_at":"2026-08-03T16:43:57.799392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-03T05:14:21.845716Z","title":"Y., Cho, K., Sukhbaatar, S., Xu, J., and Weston, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.02979","last_updated":"2026-05-24T21:03:36Z","snapshot_observed_at":"2026-08-03T05:14:15.579080Z","submitted_at":"2026-02-03T01:38:53Z","title":"CPMobius: Iterative Coach-Player Reasoning for Data-Free Reinforcement Learning","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T05:14:21.845716Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2602.02979"},"observation_digest":"sha256:37eacb87a5d9c689293c671c3dec134b6483636dd623c3ce551b5e568671e207","observation_id":"23a6939e-eb50-4155-bcc8-347fa703c964","resolution":{"observed_at":"2026-08-03T05:14:21.845716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-02T18:34:55.457454Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.08956","last_updated":"2026-07-27T05:26:49Z","snapshot_observed_at":"2026-08-06T01:24:30.721846Z","submitted_at":"2026-03-09T21:43:10Z","title":"A Survey of Reinforcement Learning For Economics","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T18:34:55.457454Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2603.08956"},"observation_digest":"sha256:827ac9d9ebddb3c6ef91b9d1d030ee3037c013686e73f431ede3c6f77a3bfdd1","observation_id":"6f426e85-277b-48ca-a7f0-571f93d4a738","resolution":{"observed_at":"2026-08-02T18:34:55.457454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2603.10047","last_updated":"2026-04-05T17:09:59Z","snapshot_observed_at":"2026-08-02T19:31:57.617822Z","submitted_at":"2026-03-08T19:15:13Z","title":"Toward Epistemic Stability: Engineering Consistent Procedures for Industrial LLM Hallucination Reduction","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-15T14:26:09.893096Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2603.10047"},"observation_digest":"sha256:a93f2d3c721f3eed782c82ad9d8f343a8f9d37b93c0ba6dbb1eb801bec81f0b5","observation_id":"3533ebd3-39cb-403a-aeed-c2988b2bfc98","resolution":{"observed_at":"2026-05-15T14:30:03.693172Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2603.13224","last_updated":"2026-05-09T03:24:22Z","snapshot_observed_at":"2026-08-05T18:39:49.396872Z","submitted_at":"2026-03-13T17:58:14Z","title":"Visual-ERM: Reward Modeling for Visual Equivalence","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T11:19:42.002790Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2603.13224"},"observation_digest":"sha256:f851ef71dd1ac70fdb155cef73255e86ffb8a65b2bc07ee3b26ba3383d9390f3","observation_id":"eba0c7ab-2891-47b2-8a99-792297af4b3e","resolution":{"observed_at":"2026-05-15T11:19:57.863750Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2603.21362","last_updated":"2026-05-10T14:58:22Z","snapshot_observed_at":"2026-08-02T21:54:03.300066Z","submitted_at":"2026-03-22T18:47:34Z","title":"AdaRubric: Task-Adaptive Rubrics for Reliable LLM Agent Evaluation and Reward Learning","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-15T06:45:59.036473Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2603.21362"},"observation_digest":"sha256:154aa6aca1ae195a70fe625572ddd92ece22ba05952285b9179cf6f880fb4630","observation_id":"9fc9fe92-33da-447d-bf00-19bbdd65bba2","resolution":{"observed_at":"2026-05-15T06:49:49.343051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.03993","last_updated":"2026-04-05T06:30:50Z","snapshot_observed_at":"2026-07-06T22:53:01.835843Z","submitted_at":"2026-04-05T06:30:50Z","title":"Can LLMs Learn to Reason Robustly under Noisy Supervision?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T16:58:42.129870Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.03993"},"observation_digest":"sha256:ff07ec733bcd68a15707afb73a8239a6d24d6d10e536f67312ee3396e6bdab56","observation_id":"c7b12d90-1405-4881-b3fe-0620883b79b4","resolution":{"observed_at":"2026-05-13T17:08:01.273470Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.09791","last_updated":"2026-04-10T18:13:09Z","snapshot_observed_at":"2026-07-06T22:58:34.504325Z","submitted_at":"2026-04-10T18:13:09Z","title":"Pioneer Agent: Continual Improvement of Small Language Models in Production","version":1},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-10T17:48:40.520740Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.09791"},"observation_digest":"sha256:416dcc006c7532b83e10543ad0363e37d6aa98988529eeb438c598dbceb386d1","observation_id":"0b86fdbb-a4f8-40b7-b35f-7d04808a240c","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.11611","last_updated":"2026-04-13T15:18:51Z","snapshot_observed_at":"2026-08-03T04:42:04.030843Z","submitted_at":"2026-04-13T15:18:51Z","title":"Utilizing and Calibrating Hindsight Process Rewards via Reinforcement with Mutual Information Self-Evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T15:32:01.575073Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.11611"},"observation_digest":"sha256:3541906ddae610147b3cc2a59a86efafd5b25689fc2668d0130355a41de76d85","observation_id":"b8982aa8-85e4-4c2b-aaa4-469763691a53","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.16335","last_updated":"2026-03-13T02:23:49Z","snapshot_observed_at":"2026-08-04T04:51:19.798134Z","submitted_at":"2026-03-13T02:23:49Z","title":"Beyond Verifiable Rewards: Rubric-Based GRM for Reinforced Fine-Tuning SWE Agents","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T12:22:13.551709Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.16335"},"observation_digest":"sha256:1017768e9f88cf9d8544c135eb4746c3fd7ec08ff81958ccbcc0da09eaaf501d","observation_id":"d9b6c656-ea4e-4272-8718-995a3aac259d","resolution":{"observed_at":"2026-05-15T12:25:35.780289Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.17543","last_updated":"2026-04-19T17:06:56Z","snapshot_observed_at":"2026-07-06T23:04:37.370465Z","submitted_at":"2026-04-19T17:06:56Z","title":"PoliLegalLM: A Technical Report on a Large Language Model for Political and Legal Affairs","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T06:03:01.460352Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.17543"},"observation_digest":"sha256:f84b5d68f07e33f0bae1c882a46f078fa39b835ea9fdacc12c201d28fb396cbc","observation_id":"d66bfeb8-2c50-445c-a393-a8a05754e4df","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.18002","last_updated":"2026-04-20T09:26:28Z","snapshot_observed_at":"2026-07-06T23:04:59.629739Z","submitted_at":"2026-04-20T09:26:28Z","title":"Neural Garbage Collection: Learning to Forget while Learning to Reason","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T04:57:12.923258Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.18002"},"observation_digest":"sha256:0fffa2103f38f29225997fd5a59e55c8481872aa43edb6c841faaf6e17363e34","observation_id":"edb53ea2-d14a-4f08-a049-cd13b4ddc6ea","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.20933","last_updated":"2026-04-22T11:52:21Z","snapshot_observed_at":"2026-07-30T07:55:19.034385Z","submitted_at":"2026-04-22T11:52:21Z","title":"IRIS: Interpolative R\\'enyi Iterative Self-play for Large Language Model Fine-Tuning","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-05-10T01:15:12.985803Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.20933"},"observation_digest":"sha256:46ac0a3d07efa66ad8a4002f97a9911bb0acc1dd8717ee401e5dbae5ef8ed185","observation_id":"fdc661dd-a1be-4a94-9a16-75e501a7e4e6","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2604.27488","last_updated":"2026-04-30T06:39:37Z","snapshot_observed_at":"2026-07-06T23:12:57.730833Z","submitted_at":"2026-04-30T06:39:37Z","title":"Skills-Coach: A Self-Evolving Skill Optimizer via Training-Free GRPO","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-07T09:56:14.913173Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2604.27488"},"observation_digest":"sha256:8e4aa8cbade2d2af83a590b0e11670b9daf2fc4e4ee1c02ffc7d008259993937","observation_id":"541196b6-1eb7-4750-9d55-e6443b126665","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-08T19:14:22.162163Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:048a8c961e51d304d7ee952770f5a54db69f05c2de6e5e982f08eaca6b444e0d","observation_id":"26262ddf-924c-41f0-817c-81ffcecffe56","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.02073","last_updated":"2026-05-08T17:11:09Z","snapshot_observed_at":"2026-08-02T23:23:17.487808Z","submitted_at":"2026-05-03T22:01:25Z","title":"Enhanced LLM Reasoning by Optimizing Reward Functions with Search-Driven Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:46.725354Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.02073"},"observation_digest":"sha256:aa2c79570dc5eb383de0d048b8f1400a9cc4e23ed5956dce56c23df56a0423f7","observation_id":"bb5d7e04-394e-4cf1-a2a8-843f79faa19a","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.03042","last_updated":"2026-05-04T18:10:15Z","snapshot_observed_at":"2026-07-06T23:16:00.796105Z","submitted_at":"2026-05-04T18:10:15Z","title":"ARIS: Autonomous Research via Adversarial Multi-Agent Collaboration","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:58:27.418883Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.03042"},"observation_digest":"sha256:1b06cf20d716515ce4826e695a17b2162f38bf1ad415c10fe27cfb8edee895e9","observation_id":"72394f1c-9f91-4a31-872c-bd37d4cad5da","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.06642","last_updated":"2026-05-07T17:51:16Z","snapshot_observed_at":"2026-07-06T23:19:05.764765Z","submitted_at":"2026-05-07T17:51:16Z","title":"StraTA: Incentivizing Agentic Reinforcement Learning with Strategic Trajectory Abstraction","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-08T09:59:48.604813Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.06642"},"observation_digest":"sha256:c00656b6ea191132a6b4ce7a3fe0e0259bea3e267e14dd6c90067baed467b957","observation_id":"2ade9202-b664-440e-8877-40ef044adc74","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.07465","last_updated":"2026-05-08T09:13:12Z","snapshot_observed_at":"2026-07-06T23:19:51.414344Z","submitted_at":"2026-05-08T09:13:12Z","title":"SEIF: Self-Evolving Reinforcement Learning for Instruction Following","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-11T01:51:09.514927Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.07465"},"observation_digest":"sha256:5b2ae7536ea95da3ed605437f64a29e0289862658752509daf57aaa1f80cb177","observation_id":"ee02b45c-13a6-472d-b9b2-2ebc2d966ee3","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.08094","last_updated":"2026-04-09T18:00:47Z","snapshot_observed_at":"2026-08-02T05:04:09.143025Z","submitted_at":"2026-04-09T18:00:47Z","title":"MedThink: Enhancing Diagnostic Accuracy in Small Models via Teacher-Guided Reasoning Correction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-12T01:22:15.608348Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.08094"},"observation_digest":"sha256:e8b924d86b7e353db2478c3d1cfdccaa85bcdfcc557777e9892f385eb032f206","observation_id":"74acb89b-9a59-48b2-bcba-d1196ba93e95","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.08558","last_updated":"2026-05-08T23:36:53Z","snapshot_observed_at":"2026-08-01T22:46:12.521758Z","submitted_at":"2026-05-08T23:36:53Z","title":"Beyond Static Bias: Adaptive Multi-Fidelity Bandits with Improving Proxies","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:11.354047Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.08558"},"observation_digest":"sha256:bd491f70b7e571b5811e0fbf5c5a2bad768bab5ae4373e80807f1ffe40394481","observation_id":"a8e753a1-485a-4b49-b492-234c6d25770d","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.08873","last_updated":"2026-05-09T10:51:58Z","snapshot_observed_at":"2026-07-06T23:21:02.177557Z","submitted_at":"2026-05-09T10:51:58Z","title":"CoDistill-GRPO: A Co-Distillation Recipe for Efficient Group Relative Policy Optimization","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-12T00:59:44.364491Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.08873"},"observation_digest":"sha256:e9e3dd6d64e6cca0c0fcc6ec2c6501dbc18756abb0d0b9da8686cf826f126a86","observation_id":"1744a6ae-c52c-4356-b868-0588f0b8a435","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.11299","last_updated":"2026-05-13T03:29:35Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-11T22:34:45Z","title":"Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T02:25:58.830629Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.11299"},"observation_digest":"sha256:38b8a411cad614472ec4d5d269551fda2a8fab9bb50ac7b47d2168d78e8f2e46","observation_id":"33059efc-3cad-4536-8292-f914a96910dc","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.11299","last_updated":"2026-05-13T03:29:35Z","snapshot_observed_at":"2026-07-06T23:23:11.928199Z","submitted_at":"2026-05-11T22:34:45Z","title":"Primal Generation, Dual Judgment: Self-Training from Test-Time Scaling","version":2},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-14T20:46:38.558668Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.11299"},"observation_digest":"sha256:31cfa70db4ad4898da9fc76531289263c49b450db9fe548a7ecfa2d66f36853d","observation_id":"88791b15-faf8-4e8d-ae65-0c2d42a27a52","resolution":{"observed_at":"2026-05-14T20:47:58.105294Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.11613","last_updated":"2026-05-12T06:43:17Z","snapshot_observed_at":"2026-07-06T23:23:26.077921Z","submitted_at":"2026-05-12T06:43:17Z","title":"From Generic Correlation to Input-Specific Credit in On-Policy Self Distillation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T01:24:34.093541Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.11613"},"observation_digest":"sha256:6fbf2429c043babcfd90dba1942499e94ab816b135f57773d221e804cde227d7","observation_id":"bd14f2d7-e531-4521-8c78-c8b52055df3b","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:ec5b1c85a5a79a0ab4d3a13d515fd766d4dc233579637c2b1280235d234635f0","observation_id":"754e0a15-3f02-4279-b195-0293cbe81b07","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:f732fc32e1a05d8f136b93a671a519e92ce6fa8c18614264452bdf441be647d7","observation_id":"af8ddb94-9ef2-4529-9439-fac1feeffc13","resolution":{"observed_at":"2026-05-13T12:01:42.779186Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":140,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:900cb71edb360e360ebeb4c1cad08965f3a3f740a28dbe7a2111a25b4be197b3","observation_id":"2fbb6b58-ab9a-49a9-b585-7807f0343689","resolution":{"observed_at":"2026-05-15T05:45:06.693643Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.14445","last_updated":"2026-05-14T06:39:42Z","snapshot_observed_at":"2026-08-01T15:27:40.908509Z","submitted_at":"2026-05-14T06:39:42Z","title":"FrontierSmith: Synthesizing Open-Ended Coding Problems at Scale","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T02:02:25.597640Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.14445"},"observation_digest":"sha256:2edaf08c2380ec1a90c2257322624c2bea0ce7912070b72ac793e6bd69fec0b4","observation_id":"00f64250-d0ca-494e-841a-b32e878676b4","resolution":{"observed_at":"2026-05-15T02:03:28.920751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.14733","last_updated":"2026-05-14T11:56:14Z","snapshot_observed_at":"2026-08-06T01:04:24.065010Z","submitted_at":"2026-05-14T11:56:14Z","title":"Video-Zero: Self-Evolution Video Understanding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T21:32:16.939563Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.14733"},"observation_digest":"sha256:55f040284180310d3843d2be248399c33ddddac0032b3e58b4dd5e47ee67584a","observation_id":"3b80c03c-943c-4d49-a5b8-e2a91782a24b","resolution":{"observed_at":"2026-06-30T21:35:04.364598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.15300","last_updated":"2026-05-14T18:14:15Z","snapshot_observed_at":"2026-07-06T23:26:37.362117Z","submitted_at":"2026-05-14T18:14:15Z","title":"Deep Pre-Alignment for VLMs","version":1},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-19T16:26:41.094936Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.15300"},"observation_digest":"sha256:c70e8631009a580ec1ead369dd9b4f51c0c95b7f2b1831bb660d46719be10c65","observation_id":"a4fd26ba-f14e-45a1-9ef4-da2ad38dc904","resolution":{"observed_at":"2026-05-19T16:27:39.147627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.17900","last_updated":"2026-05-18T06:06:01Z","snapshot_observed_at":"2026-08-02T23:40:34.130341Z","submitted_at":"2026-05-18T06:06:01Z","title":"DuIVRS-2: An LLM-based Interactive Voice Response System for Large-scale POI Attribute Acquisition","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-20T10:30:48.957568Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.17900"},"observation_digest":"sha256:9fc44c0c3e8c1cfb4dfc11b929eec604307516d4cffb2f50a63cdce82b5d5660","observation_id":"d4bf3bf9-45f9-4391-a1f3-3593c8db321e","resolution":{"observed_at":"2026-05-20T10:33:12.946146Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:10784ddd8ade555bef5fa33fea0d9ee2d5b70e91c59559d1756398c02550b97b","observation_id":"8d10e24a-c840-471a-8ef0-a4b4a6b7cef6","resolution":{"observed_at":"2026-05-21T11:24:08.705016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2605.20506","last_updated":"2026-05-19T21:23:24Z","snapshot_observed_at":"2026-08-03T04:27:59.284440Z","submitted_at":"2026-05-19T21:23:24Z","title":"Reinforcing Human Behavior Simulation via Verbal Feedback","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-21T07:21:48.649289Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2605.20506"},"observation_digest":"sha256:66b31bff8a855bd766494f3bbe599c030fd74c642ca822e69700569295dd77d2","observation_id":"66035c1a-aac5-4f27-bc4d-4f300070f43d","resolution":{"observed_at":"2026-05-21T07:24:02.403329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.00424","last_updated":"2026-05-29T23:21:48Z","snapshot_observed_at":"2026-08-02T07:23:01.039858Z","submitted_at":"2026-05-29T23:21:48Z","title":"Weak Critics Make Strong Learners: On-Policy Critique Distillation for Scalable Oversight","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T21:55:58.645062Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.00424"},"observation_digest":"sha256:5d922a8f470d6f046c3b15e05d7b61603b9068a5e5f028f486595ab726177db2","observation_id":"7d53a406-9368-45d7-9cbe-58e7d17e1046","resolution":{"observed_at":"2026-07-01T19:56:11.018058Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.00902","last_updated":"2026-05-30T21:54:02Z","snapshot_observed_at":"2026-08-03T19:36:42.912181Z","submitted_at":"2026-05-30T21:54:02Z","title":"Ryze: Evidence-Enriched Data Synthesis from Biomedical Papers","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-28T18:21:22.421280Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.00902"},"observation_digest":"sha256:715110920b52c12aaa8ed654b0aaf65e32cc07c2a18911b66da2c72591414413","observation_id":"4c04b105-014c-4767-84ed-167cb91426d6","resolution":{"observed_at":"2026-06-28T20:42:37.884408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.01091","last_updated":"2026-05-31T08:25:04Z","snapshot_observed_at":"2026-08-03T09:35:27.663835Z","submitted_at":"2026-05-31T08:25:04Z","title":"Deep Research as Rubric for Reinforcement Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:16:16.243967Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.01091"},"observation_digest":"sha256:c708f7869a66c1586186d6960bd7810228f33e36bc6d0cadbeeb32a5155db8df","observation_id":"3f85ff3b-6de0-4164-9839-a75efce56570","resolution":{"observed_at":"2026-06-28T17:22:25.254132Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.01249","last_updated":"2026-06-17T04:44:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-31T14:04:51Z","title":"Trust Region On-Policy Distillation","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-06-28T17:38:50.313305Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.01249"},"observation_digest":"sha256:96bf696508be507dafc3b38a967faa9e3f4ea5bcc086cd96682286bfe1d89b1a","observation_id":"e3ae54f1-7685-4b9e-8614-c3c8a25126c1","resolution":{"observed_at":"2026-07-01T20:46:14.371457Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.03608","last_updated":"2026-06-02T13:11:09Z","snapshot_observed_at":"2026-08-02T07:41:20.436955Z","submitted_at":"2026-06-02T13:11:09Z","title":"Exploiting Verification-Generation Gap: Test-Time Reinforcement Learning with Confidence-Conditioned Verification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T10:53:00.223228Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.03608"},"observation_digest":"sha256:25d37528e68238be87634f3edbca81a3d745b47ccd976877aa774912e9f6ca76","observation_id":"a2729d11-3347-4b24-91bd-84380aa0c271","resolution":{"observed_at":"2026-07-02T02:26:27.255554Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.05263","last_updated":"2026-06-03T16:19:36Z","snapshot_observed_at":"2026-07-06T23:45:19.055840Z","submitted_at":"2026-06-03T16:19:36Z","title":"Policy-Conditioned Counterfactual Credit for Verifiable Reinforcement Learning of Long-Horizon Language Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-28T07:34:18.370135Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.05263"},"observation_digest":"sha256:63d6c03d49ca293d6d227f4a619b04fbc543efe8ca4f4aa48bef7f3ea7bfbc5f","observation_id":"f325a507-3750-4a3c-ab35-355bd749c9d0","resolution":{"observed_at":"2026-07-02T06:06:41.596133Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.11127","last_updated":"2026-06-09T17:24:27Z","snapshot_observed_at":"2026-07-06T23:50:16.299969Z","submitted_at":"2026-06-09T17:24:27Z","title":"Provenance-Grounded Gating and Adaptive Recovery in Synthetic Post-Training Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T12:55:11.402557Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.11127"},"observation_digest":"sha256:9080af9725f98ade749cfad9a3c0bbb0ed09c760803117eb0e8b765ed94f7677","observation_id":"c2ef25eb-40bc-4a71-8fea-c8e652265e88","resolution":{"observed_at":"2026-07-03T06:07:41.401853Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.11719","last_updated":"2026-07-29T11:18:42Z","snapshot_observed_at":"2026-08-04T21:44:41.103713Z","submitted_at":"2026-06-10T06:49:21Z","title":"Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-27T10:26:51.429436Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.11719"},"observation_digest":"sha256:4cc9512e3332abd3fb8cdebff40a51749e91120945499a9a3da84eb6c545e410","observation_id":"c8f387f7-9032-4d3a-9bc6-ead6f3f9782d","resolution":{"observed_at":"2026-07-03T09:17:48.632412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-02T11:51:37.183739Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.11719","last_updated":"2026-07-29T11:18:42Z","snapshot_observed_at":"2026-08-04T21:44:41.103713Z","submitted_at":"2026-06-10T06:49:21Z","title":"Ouroboros-Spatial: Closing the Data-Model Loop for Spatial Reasoning","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T11:51:37.183739Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.11719"},"observation_digest":"sha256:f0d853715f707edc84620f978dbe5d5e2013de3b4d0516b7dacefe465dfc6b87","observation_id":"c47cb9a6-e728-43a6-bc43-322a6d365ff7","resolution":{"observed_at":"2026-08-02T11:51:37.183739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.11909","last_updated":"2026-06-10T10:37:27Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T10:37:27Z","title":"Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T09:48:49.786021Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.11909"},"observation_digest":"sha256:a8413aacf92b38863e3b29daf223a3c26c7201a6193803558c88e6650211fcc3","observation_id":"c2378224-a61f-43f3-af19-e24cc36c68e7","resolution":{"observed_at":"2026-07-03T10:48:02.883263Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.21090","last_updated":"2026-06-17T18:03:06Z","snapshot_observed_at":"2026-07-30T06:23:05.041940Z","submitted_at":"2026-06-17T18:03:06Z","title":"Self-Improvement Can Self-Regress: The Rise-and-Collapse Failure Mode of LLM Self-Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T21:07:28.660119Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.21090"},"observation_digest":"sha256:d190824c77758acc86a7d5b6681f14ce63fbed7a145533f824f328b7353c9615","observation_id":"6957cad2-ce98-4d45-9395-7b1907aa4b4e","resolution":{"observed_at":"2026-07-04T00:29:16.725900Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.21943","last_updated":"2026-06-20T08:20:41Z","snapshot_observed_at":"2026-07-06T23:56:54.959593Z","submitted_at":"2026-06-20T08:20:41Z","title":"Modularized Reinforcement Learning on LLMs: From MDP Creation to Exploration and Learning","version":1},"reference_index":252,"source":"pdf_text","source_observed_at":"2026-06-26T12:15:08.304150Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.21943"},"observation_digest":"sha256:11a0af7918b9c67d9c5d921f9b4fc038637a04073945ec7660d2e5280fb9b092","observation_id":"1dc97d87-059a-4ada-8bdc-4668aa4cba7f","resolution":{"observed_at":"2026-07-04T08:09:40.710745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.22495","last_updated":"2026-06-21T13:34:18Z","snapshot_observed_at":"2026-08-04T03:35:42.142897Z","submitted_at":"2026-06-21T13:34:18Z","title":"Grounded Scaling: Why Agentic AI Needs Deterministic Environments","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T10:51:34.720931Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.22495"},"observation_digest":"sha256:36f3cfe177bc8d6d144fc2ae6bef83c9d5668194c11de61f8d857f8b3e37cad3","observation_id":"f4494c5f-6319-4502-acd6-7ff65dac4369","resolution":{"observed_at":"2026-07-04T08:49:42.653791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.23124","last_updated":"2026-06-22T10:09:52Z","snapshot_observed_at":"2026-08-06T01:27:36.303427Z","submitted_at":"2026-06-22T10:09:52Z","title":"PRIDE: Privileged Information-enhanced Distillation for Empathetic Dialogue Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T08:37:10.149519Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.23124"},"observation_digest":"sha256:8ab9f2d72f03e3b8faa2a29cec3bc73b78945d1fb9c35062f6c60fad5d7dd421","observation_id":"d9270c68-6889-43cc-9d2b-564542049922","resolution":{"observed_at":"2026-07-04T10:39:45.645866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.28401","last_updated":"2026-06-24T11:06:22Z","snapshot_observed_at":"2026-07-07T00:02:29.000757Z","submitted_at":"2026-06-24T11:06:22Z","title":"Vision-driven Preference Synthesis for Mitigating Hallucinations in VLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-30T01:22:16.176398Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.28401"},"observation_digest":"sha256:a7ac7715038aeb5149ddfa993f80e650fa1cfa0e61d6be96699f9521a34b5006","observation_id":"e49e096e-fe76-41bf-b4d4-74b231a50bbf","resolution":{"observed_at":"2026-07-01T15:35:47.629107Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2606.28898","last_updated":"2026-06-27T13:02:13Z","snapshot_observed_at":"2026-08-06T05:16:31.950828Z","submitted_at":"2026-06-27T13:02:13Z","title":"PASTA: A Paraphrasing And Self-Training Approach for Knowledge Updating in LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T09:42:40.357949Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2606.28898"},"observation_digest":"sha256:781e93faadd808ea2181d36e276187b58358196f74322d5cb582b88467881546","observation_id":"98e891cc-9b8b-4972-9a39-c755dc36ee82","resolution":{"observed_at":"2026-06-30T09:44:37.488982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2607.00531","last_updated":"2026-07-01T07:22:46Z","snapshot_observed_at":"2026-08-05T15:12:09.427437Z","submitted_at":"2026-07-01T07:22:46Z","title":"Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-02T16:07:49.362916Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.00531"},"observation_digest":"sha256:cbb0fabc204dd45b40c87b40bff9d0dcf06915eba33ef664b901e75efd302f82","observation_id":"3f49bf9b-6d01-49a2-aa20-a5051b328941","resolution":{"observed_at":"2026-07-02T16:17:08.604101Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2401.10020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":210,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:1d78a9e25abf0ff097a87cb0f14370f2b706db12014672791161d2688519f3b4","observation_id":"733794e4-1aa9-4014-8757-65abe37e24ba","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-02T08:40:56.757215Z","title":"arXiv preprint arXiv:2401.10020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":211,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:56.757215Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:0eb475cbb97fb6e5283763ff2249d0d341ef5fb35d9eaaec89dc9a1261dcfc69","observation_id":"d57da815-ead9-4632-b797-8533f778b58e","resolution":{"observed_at":"2026-08-02T08:40:56.757215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2607.05382","last_updated":"2026-07-24T20:32:35Z","snapshot_observed_at":"2026-08-05T09:49:25.195615Z","submitted_at":"2026-07-06T17:56:12Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-07T13:18:50.793715Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05382"},"observation_digest":"sha256:49600213f1b308861d26a72c378b618435935fc3a989b855d44d3efd55f41d56","observation_id":"615534d4-4def-4d21-ad04-1e6b9a311a42","resolution":{"observed_at":"2026-07-07T13:23:47.420272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-11T07:09:39.972776Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05382","last_updated":"2026-07-24T20:32:35Z","snapshot_observed_at":"2026-08-05T09:49:25.195615Z","submitted_at":"2026-07-06T17:56:12Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T07:09:39.972776Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05382"},"observation_digest":"sha256:64618c4d1cd9aa685bae33720b41c0b7720100d81c077b4cc315264b3d380dc7","observation_id":"c51813a2-1fc2-4974-8364-f77c13fce7b9","resolution":{"observed_at":"2026-07-11T07:09:39.972776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-02T08:32:10.968750Z","title":"arXiv preprint arXiv:2401.10020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05382","last_updated":"2026-07-24T20:32:35Z","snapshot_observed_at":"2026-08-05T09:49:25.195615Z","submitted_at":"2026-07-06T17:56:12Z","title":"Search Beyond What Can Be Taught: Evolving the Knowledge Boundary in Agentic Visual Generation","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-02T08:32:10.968750Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05382"},"observation_digest":"sha256:d89fc869159991ade7563b2cf696cd6264d1986ecccf1f129b892a5802635ede","observation_id":"3ec5e70a-4643-450b-835c-7f868db92e59","resolution":{"observed_at":"2026-08-02T08:32:10.968750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-07T12:31:42.224094Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:212337064a484ab96e271911a1aa798d2c951119568d3a7365c97581207d69b0","observation_id":"37b4c542-cd58-4b90-b3f2-5b6767c91cf2","resolution":{"observed_at":"2026-07-07T12:33:45.183403Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-11T07:01:56.628017Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.05394","last_updated":"2026-07-08T17:57:18Z","snapshot_observed_at":"2026-08-02T11:12:50.300654Z","submitted_at":"2026-07-06T17:59:58Z","title":"Weak-to-Strong Generalization via Direct On-Policy Distillation","version":2},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-11T07:01:56.628017Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05394"},"observation_digest":"sha256:2eb2b0ac3a8ab9971f03688d1452b082a49c96b398aef3c5f5392873cd3beace","observation_id":"36f27840-916c-40e0-a746-c4ccd5e21f1b","resolution":{"observed_at":"2026-07-11T07:01:56.628017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2607.05904","last_updated":"2026-07-07T06:59:30Z","snapshot_observed_at":"2026-08-03T03:37:40.612823Z","submitted_at":"2026-07-07T06:59:30Z","title":"More Convincing, Not More Correct: Self-Play Reward Hacking of Reference-Free LLM Judges","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T21:20:07.569587Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.05904"},"observation_digest":"sha256:f563a6f84edaf29df17aaf07798a295fcfcca06cbd3db794f2fa181dc046f43c","observation_id":"3f3cf442-54df-48bf-9996-6e8ce059e79d","resolution":{"observed_at":"2026-07-08T21:25:38.628686Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":"2401.10020","doi":"10.48550/arxiv.2401.10020","metadata_source":"pith","pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Rewarding Language Models","venue":"cs.CL","work_id":"b3903c9e-1bc7-4267-a171-6311902be2a4","year":2024},"citing_paper":{"arxiv_id":"2607.07663","last_updated":"2026-07-08T17:19:50Z","snapshot_observed_at":"2026-07-30T01:44:04.256851Z","submitted_at":"2026-07-08T17:19:50Z","title":"Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-09T03:36:57.168246Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.07663"},"observation_digest":"sha256:8c0654193f2c984257f64f0d2803c62fc7e3f1738953df84168bf23f695731d0","observation_id":"47f64fd4-1aa6-4d0e-89f7-1d4fef9652ac","resolution":{"observed_at":"2026-07-09T03:45:55.566585Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:11.326851+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-13T05:28:45.311405Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-07-16T23:18:48.719406Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-13T05:28:45.311405Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:b0b621a2ae850ed6d3e464348d519891398495b6c463dad87cc214b207c6f08d","observation_id":"d69d0e54-baf0-44b8-8252-193322e536a8","resolution":{"observed_at":"2026-07-13T05:28:45.311405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-14T15:24:58.589243Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.08964","last_updated":"2026-07-13T06:00:47Z","snapshot_observed_at":"2026-07-16T23:18:48.719406Z","submitted_at":"2026-07-09T21:56:37Z","title":"Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T15:24:58.589243Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.08964"},"observation_digest":"sha256:bb0d395e9816c9b0fb9ecfe90403e016cb075a72bdec8f7eaa0eeeb718df3d0b","observation_id":"52d4ddb4-5b6b-4cca-a130-6451205cf9a5","resolution":{"observed_at":"2026-07-14T15:24:58.589243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-14T10:33:54.851493Z","title":"Self-rewarding language models.International Conference on Machine Learning (ICML), 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10601","last_updated":"2026-07-12T06:38:55Z","snapshot_observed_at":"2026-07-16T23:18:52.250852Z","submitted_at":"2026-07-12T06:38:55Z","title":"Agentic-DPO: From Imitation to Agentic Policy Optimization on Expert Trajectories","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T10:33:54.851493Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.10601"},"observation_digest":"sha256:704091f3640834e1fd4355eaa84fcfcb53039ee277f8f0d52026057184012718","observation_id":"e7c1d6fa-76c3-40ae-a3d0-e44b3ee16705","resolution":{"observed_at":"2026-07-14T10:33:54.851493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-07-14T06:09:46.933171Z","title":"Self- rewarding language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.11228","last_updated":"2026-07-13T08:19:09Z","snapshot_observed_at":"2026-08-02T17:44:08.904769Z","submitted_at":"2026-07-13T08:19:09Z","title":"DeepBias: Adaptive In-depth Probing of Social Biases in LVLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T06:09:46.933171Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.11228"},"observation_digest":"sha256:6fe12286604f97bce0e12cc6e6effa07ec9dec64495c2fd0b231124fd3e42e74","observation_id":"be6e5875-72f5-48ee-b4e1-3f8dd21fcfb8","resolution":{"observed_at":"2026-07-14T06:09:46.933171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-01T15:21:20.171156Z","title":"arXiv preprint arXiv:2401.10020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18470","last_updated":"2026-07-20T19:40:25Z","snapshot_observed_at":"2026-08-02T23:22:19.885187Z","submitted_at":"2026-07-20T19:40:25Z","title":"RRPO: Reference-Relative Policy Optimization with Stratified Conditional Rollouts","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T15:21:20.171156Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.18470"},"observation_digest":"sha256:64321cc6986b674d61df0bdd85b3a60b9dff5fab7695c640e4b33e6ad016f04e","observation_id":"026459f0-1812-4435-92d0-5f8ab495ed82","resolution":{"observed_at":"2026-08-01T15:21:20.171156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-02T13:32:14.589133Z","title":"arXiv preprint arXiv:2401.10020 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19354","last_updated":"2026-05-21T18:09:33Z","snapshot_observed_at":"2026-08-02T13:32:08.137554Z","submitted_at":"2026-05-21T18:09:33Z","title":"FormulaSPIN: Self-Play Fine-Tuning for Natural Language to Spreadsheet Formula Generation","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-02T13:32:14.589133Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.19354"},"observation_digest":"sha256:2890c8e929c7d29bb6285ddc4cc8749b8cf44d7f174f036b7c0db3e30dc38f59","observation_id":"08c10460-733c-472e-98c8-325aedeb5194","resolution":{"observed_at":"2026-08-02T13:32:14.589133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-01T03:14:13.190121Z","title":"arXiv:2401.10020","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26094","last_updated":"2026-07-28T02:09:26Z","snapshot_observed_at":"2026-08-05T20:24:58.318060Z","submitted_at":"2026-07-28T02:09:26Z","title":"Meta-Learned Reward Shaping for Reinforcement Learning from Human Feedback","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T03:14:13.190121Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2607.26094"},"observation_digest":"sha256:65ddcb8cb4173160aacba2f1a786f5696c251bf7572d44799f77190c8a88e0a4","observation_id":"547954f7-9c66-4dd1-af5b-2907541648ac","resolution":{"observed_at":"2026-08-01T03:14:13.190121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-06T00:42:59.909123Z","title":"Self-rewarding language models.arXiv preprint arXiv:2401.10020, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01000","last_updated":"2026-08-02T05:00:44Z","snapshot_observed_at":"2026-08-06T04:36:18.832605Z","submitted_at":"2026-08-02T05:00:44Z","title":"Judging Is Not Enumerating: Silent Omissions in LLM-Authored Acceptable Sets","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:42:59.909123Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2608.01000"},"observation_digest":"sha256:653162de03a4e9b73739245c3cbd49871fcb12385928d05c72f7ee3637b498ab","observation_id":"1b7c10b3-f874-4fe8-8bb0-b59dfb1efac2","resolution":{"observed_at":"2026-08-06T00:42:59.909123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.10020/citation-record","integrity":"/paper/2401.10020/integrity","json":"/paper/2401.10020/citation-record.json","paper":"/paper/2401.10020"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T15:17:22.153922Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"bd577a47-49ef-4f8a-81ca-86cd88b71479","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:ccfd7f972ebc66761259e854cc8562876014132bac6484a7864b20c2aaac1921","observation_id":"31994b54-2ec2-418c-9940-0e5dbf79ce86","resolution":{"observed_at":"2026-05-13T12:01:42.726708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Think you have solved question answering?","venue":null,"work_id":"65ee9a0a-7b80-4a03-a16e-5467747a1e24","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:9304160d95ed00a73b3a671126707592e2ce75eaceea9ad967e035ab2787522a","observation_id":"725116c1-126f-4659-a96b-355d62b9efca","resolution":{"observed_at":"2026-05-13T12:01:42.595308Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2019 , journal =","venue":null,"work_id":"41c879fa-f0bb-4f50-b5be-c2b0d1b21ffa","year":2019},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:bb8b4d23f74b5bb993fbf0caa9c2f19ab5ab38f615fa334d078e9b55fa85eeac","observation_id":"d5b18464-4550-4bde-aee1-8b86426bb5c2","resolution":{"observed_at":"2026-05-13T12:01:42.598333Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.074676Z","title":"EMNLP , year=","venue":null,"work_id":"5928ce4f-4b10-4358-9287-a8ba1af28098","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:bbbd4d07733b86eb98809068c6974f4dd81e0caa950ce415416f93851a3bc20e","observation_id":"0af92e01-73e4-4365-a060-411220df14de","resolution":{"observed_at":"2026-05-13T12:01:42.601211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T02:46:43.662277Z","title":"9th International Conference on Learning Representations","venue":null,"work_id":"71e363a8-ff38-4e5f-b603-9e3c1f32e4a0","year":2021},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:4ba0a9bbab29dc2935d380cabd540c3245df055b19f1ea4155d409ecb1f8eab3","observation_id":"b1454ac6-0334-4701-9ff2-01acf8007344","resolution":{"observed_at":"2026-05-13T12:01:42.604145Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.721283Z","title":"Thirty-Fourth AAAI Conference on Artificial Intelligence , year =","venue":null,"work_id":"9dc74f0a-09fb-4db7-9820-21f1f62db5df","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:0c0e394555844a95112012f801c2c56a0dbf8db258803a253036591646ed78b2","observation_id":"f1b61372-b3e4-48a4-87f8-14087334fbc9","resolution":{"observed_at":"2026-05-13T12:01:42.607340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.865589Z","title":"ROUGE : A Package for Automatic Evaluation of Summaries","venue":null,"work_id":"8fe5eebd-ee97-4dc7-be98-147cf45c47c4","year":2004},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:7f77c74a831bf6b0695b0a0804a0aaaf9d7956b7349017eec7e1f6d1b0a47b70","observation_id":"adfac2cf-8595-43c9-940a-ae239c7daced","resolution":{"observed_at":"2026-05-13T12:01:42.610330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , howpublished =","venue":null,"work_id":"2746f6f1-22e4-4714-8779-aa50c0ea1879","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:c8d22f5c15c1f47d4be778ad35743c90d247516ef7673e69c27c610711d09c53","observation_id":"2933b852-04f0-4fac-9f69-a952b05ad815","resolution":{"observed_at":"2026-05-13T12:01:42.614142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06709","last_updated":"2016-06-03T15:09:54Z","snapshot_observed_at":"2026-08-01T22:04:29.946918Z","submitted_at":"2015-11-20T17:58:37Z","title":"Improving Neural Machine Translation Models with Monolingual Data","version":4},"cited_work":{"arxiv_id":"1511.06709","doi":"10.48550/arxiv.1511.06709","metadata_source":"pith","pith_arxiv_id":"1511.06709","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Improving Neural Machine Translation Models with Monolingual Data","venue":"cs.CL","work_id":"7638cefa-d38f-484c-8ae3-ea5abb38db38","year":2015},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1511.06709","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:26b2aa3563e1241b25fab9d7629f5850cfbd29e77ee3e7e0eab706eca547cdcb","observation_id":"64f1b9d9-6415-40b2-9a78-b7c4d56d4a17","resolution":{"observed_at":"2026-05-13T12:01:42.374858Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.06442","last_updated":"2019-06-15T00:36:41Z","snapshot_observed_at":"2026-08-01T23:35:59.141006Z","submitted_at":"2019-06-15T00:36:41Z","title":"Tagged Back-Translation","version":1},"cited_work":{"arxiv_id":"1906.06442","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1906.06442","snapshot_observed_at":"2026-07-04T23:42:53.552734Z","title":"arXiv preprint arXiv:1906.06442 , year=","venue":null,"work_id":"c6edf5b0-52e6-4e90-8652-dd73699a57fc","year":1906},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1906.06442","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:20331816a60f8dd77154ad4dd8b1529f23421fc1cb6dd357729a348ebcd11d6f","observation_id":"c52f7301-bc29-450e-9902-5dda04c09567","resolution":{"observed_at":"2026-07-04T23:42:53.552734Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":"2305.14314","doi":"10.1007/978-3-031-86644-9","metadata_source":"pith","pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","venue":"cs.LG","work_id":"d3fdf68e-3a5e-48b5-8a18-7a9137479c55","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:0cfc978d71546e473445fa8a2000deda22b6fa761f267f98f455e3fd75e9558a","observation_id":"4fa5bd23-995b-4df4-b2e0-cf9d79204e56","resolution":{"observed_at":"2026-05-13T12:01:42.461178Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08460","last_updated":"2024-10-03T15:46:13Z","snapshot_observed_at":"2026-08-04T19:43:12.423655Z","submitted_at":"2023-04-17T17:36:35Z","title":"LongForm: Effective Instruction Tuning with Reverse Instructions","version":3},"cited_work":{"arxiv_id":"2304.08460","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.08460","snapshot_observed_at":"2026-07-08T15:35:07.181241Z","title":"arXiv preprint arXiv:2304.08460 , year=","venue":"cs.CL","work_id":"ba0eca3b-8d3a-4c0b-a5ab-9f898affc667","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2304.08460","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:c01c4c24b51e7ad2887e708dfdaac72f8ce29d6f6817ca7fa022b19ee1717962","observation_id":"40ff08f2-550a-491f-98dd-61d8f18cd0ab","resolution":{"observed_at":"2026-05-13T12:01:42.546745Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"d2ca2435-096b-4101-9566-c2eb0307d2b1","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:57c02a442d54867439084f656915cf7070e5bb50058680ab60d5eaf7cc9541c5","observation_id":"7af784e0-5d8f-47ae-b031-6af3d7ad3cec","resolution":{"observed_at":"2026-05-13T12:01:42.617078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11206","last_updated":"2023-05-18T17:45:22Z","snapshot_observed_at":"2026-07-06T15:29:24.259073Z","submitted_at":"2023-05-18T17:45:22Z","title":"LIMA: Less Is More for Alignment","version":1},"cited_work":{"arxiv_id":"2305.11206","doi":"10.48550/arxiv.2305.11206","metadata_source":"pith","pith_arxiv_id":"2305.11206","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LIMA: Less Is More for Alignment","venue":"cs.CL","work_id":"3986a077-ad54-4cba-bd8f-914fe1862115","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2305.11206","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:a862a15b124410a41c7cbfe552037a3e15113f10110ac6ca6ce92acd04a8cad7","observation_id":"9e057a06-22ec-426c-aa0f-14e7df7081ed","resolution":{"observed_at":"2026-05-17T11:34:13.088019Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15717","last_updated":"2023-05-25T05:00:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-25T05:00:12Z","title":"The False Promise of Imitating Proprietary LLMs","version":1},"cited_work":{"arxiv_id":"2305.15717","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15717","snapshot_observed_at":"2026-07-04T05:09:36.906364Z","title":"The False Promise of Imitating Proprietary LLMs","venue":"cs.CL","work_id":"f843d86a-7fd6-4b0d-bf8b-f1ad3fbc3f04","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2305.15717","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:80fe7c22af2f876b9c7b26b510d3c9f3af5a013dc8e39bb5fe92c2b56a39eac0","observation_id":"a7fa6976-dfbf-4bc7-93c7-59c428293d37","resolution":{"observed_at":"2026-05-18T06:54:31.902059Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":"2304.12244","doi":"10.48550/arxiv.2304.12244","metadata_source":"pith","pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","venue":"cs.CL","work_id":"fc22911b-0900-4ad2-b106-337f13279965","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:770e83d64c7364f1535ec6d9393ff6d317cf921bdbc87cb1b122368fc74a82cb","observation_id":"98fcc26b-8ee0-40ed-a112-783ac403c827","resolution":{"observed_at":"2026-05-13T12:01:42.451682Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-06T16:42:40.348897Z","title":"and Stoica, Ion and Xing, Eric P","venue":null,"work_id":"cb4b41f6-6d60-4db4-a4d1-6c5bb7899473","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:c0c869061406c2bb4e0782b69fa1dd1c054781f9f173113d4465f4fe84032dcd","observation_id":"be8aa6ee-88d2-4e99-b978-321456987a9c","resolution":{"observed_at":"2026-05-13T12:01:42.620279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:46:21.684188Z","title":"Hashimoto , title =","venue":null,"work_id":"fadc9cdf-612b-4081-85df-c1904ccef4c8","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:2a0ad6dfb07e05eceb8e79b534e447e28c177ff76adeb3aec15c6f7637517c65","observation_id":"d4616484-7a1e-4372-9165-d2878530372c","resolution":{"observed_at":"2026-05-13T12:01:42.623273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":"2304.03277","doi":"10.48550/arxiv.2304.03277","metadata_source":"pith","pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Instruction Tuning with GPT-4","venue":"cs.CL","work_id":"fd515477-f9f1-48aa-9feb-a3308e7656bb","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:e8b4de9a39cb5151fa20f16c842171d29deba9300e971c2e7ae240ae174655fb","observation_id":"19e8d7e5-02d2-4c8f-91b9-8ca1703ed691","resolution":{"observed_at":"2026-05-14T17:04:18.193148Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.12017","last_updated":"2023-01-30T05:25:59Z","snapshot_observed_at":"2026-08-02T23:44:31.455796Z","submitted_at":"2022-12-22T19:56:09Z","title":"OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization","version":3},"cited_work":{"arxiv_id":"2212.12017","doi":"10.48550/arxiv.2212.12017","metadata_source":"pith","pith_arxiv_id":"2212.12017","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OPT-IML: Scaling Language Model Instruction Meta Learning through the Lens of Generalization","venue":"cs.CL","work_id":"dd464d2b-4adb-40de-9148-c19470e7533b","year":2022},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2212.12017","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:ffef27effea9f3e1f8138a04e7a86df025707839b3776ec901b85a9517c5119d","observation_id":"b9509c37-137a-4f8e-b156-24fccf42a9d2","resolution":{"observed_at":"2026-05-17T06:08:25.849600Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv e-prints , pages=","venue":null,"work_id":"e34a2db7-bd9f-4540-9c58-2b20b454d893","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:830cf83442843e441ba732faed54e9ea6a122c98f2738dd49bef8ca96e860641","observation_id":"eafb547f-1599-40e1-9392-7deb52fd7233","resolution":{"observed_at":"2026-05-13T12:01:42.625735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d85e6aa5-ee98-4f2a-8dec-3e1b5bfa7d84","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:3a6f4d3d954fa4f785a2ede46fe4e485986a1064fe48398346e715009c084da6","observation_id":"b9bed052-c2c1-4124-a23e-78a9478662e7","resolution":{"observed_at":"2026-05-13T12:01:42.628125Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:6bb38d9c3aa00dc4ae83b2cf002f674f5e78be9a7616f89e61222c9b79d4093a","observation_id":"763f42ac-7f9f-4424-95d4-44f2f663cf0f","resolution":{"observed_at":"2026-05-13T12:01:42.405453Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto , title =","venue":null,"work_id":"974924b9-2696-40a2-a276-b14f4bd4b078","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:a02d68d2789cac3321dfcc577d624680323014ba549bc21bfba25e1e374cc70f","observation_id":"6cd73ad8-b993-4883-87fd-704103e19a2b","resolution":{"observed_at":"2026-05-13T12:01:42.631506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 45th International ACM SIGIR Conference on Research and Development in Information Retrieval , pages=","venue":null,"work_id":"43879b61-d2d1-45bf-b577-56413d93da5d","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:4ad0c6475875c56aff2a809b9b6e80df5e5495fa48ec1412cd69b96d9e1bdbd6","observation_id":"647d196f-cc9c-42cd-969a-cc80e46d4829","resolution":{"observed_at":"2026-05-13T12:01:42.634714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9f614543-069e-4294-bb19-1e3602c9a1b0","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:21bd6f380d6142bf9ae77016b6ad89facd7131f4a12224ce56df1e256df9de39","observation_id":"7ab2ef3d-d2a8-4202-8b2a-70a8251ae45d","resolution":{"observed_at":"2026-05-13T12:01:42.637591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"1142582b-e120-408d-96e6-198e0a7b838a","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:8a89ef324271921a5c0d20fbdefe94482753588f65f2aceabc92c7f02ad4b382","observation_id":"a544a119-f541-422e-8442-33020c80b8f8","resolution":{"observed_at":"2026-05-13T12:01:42.640509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2024 , url=","venue":null,"work_id":"8b12e14f-04e2-4fa3-a7e3-422e553dfe9b","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:f7c6c2c6f04abb7210029cdf2398c1cf294924e6ee546a36be45a2dad85044db","observation_id":"06370a74-d99d-4f57-af55-7ad9b48d23a0","resolution":{"observed_at":"2026-05-13T12:01:42.643491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":"2110.08207","doi":"10.48550/arxiv.2110.08207","metadata_source":"pith","pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","venue":"cs.LG","work_id":"1857c952-db2f-4810-9e3c-27a862c8d276","year":2021},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:9e2b201f5cc678219216cb924069eda309d4c5a2e90ecea831698bfd7822c0b6","observation_id":"6b530596-6414-4a8c-af4a-04358233053c","resolution":{"observed_at":"2026-05-14T17:59:43.395267Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08773","last_updated":"2022-03-14T09:15:08Z","snapshot_observed_at":"2026-08-05T18:13:22.401467Z","submitted_at":"2021-04-18T08:44:56Z","title":"Cross-Task Generalization via Natural Language Crowdsourcing Instructions","version":4},"cited_work":{"arxiv_id":"2104.08773","doi":"10.1002/wps.20513","metadata_source":"pith","pith_arxiv_id":"2104.08773","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Cross-Task Generalization via Natural Language Crowdsourcing Instructions","venue":"cs.CL","work_id":"807e5cef-0bb3-4eae-a684-154fc2d6aa06","year":2021},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2104.08773","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:76e4f7eba58376815f2e86064b1340d234fecc03a130b833a0c44c6eb16946df","observation_id":"0149cd98-8d07-4f7b-9395-33996d42f4a1","resolution":{"observed_at":"2026-05-18T01:57:29.846007Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07705","last_updated":"2022-10-24T07:00:15Z","snapshot_observed_at":"2026-07-06T13:00:53.618234Z","submitted_at":"2022-04-16T03:12:30Z","title":"Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks","version":3},"cited_work":{"arxiv_id":"2204.07705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2204.07705","snapshot_observed_at":"2026-07-04T19:20:06.492411Z","title":"Super-naturalinstructions: Generalization via declarative instructions on 1600+ nlp tasks","venue":null,"work_id":"9e87b348-47f4-4e82-8da8-3873f56cd62e","year":2022},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2204.07705","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:e8afd7c115e93ef2dd906a16855426079435bd0c1c28a97a719260b56456d2b0","observation_id":"c2dd0cec-a04b-46da-af65-812fed6f2564","resolution":{"observed_at":"2026-05-13T12:01:42.495070Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T13:54:58.981544Z","title":"Constitutional","venue":null,"work_id":"4c18fb3d-8e26-4d8e-819d-5c7b9fe6bb5d","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:b4df06776ab1d95f8c44be81b86c32acc02b1c3d261782355e9a4cc4867057cd","observation_id":"ee4707a8-990e-4426-b4aa-8027e2b0051c","resolution":{"observed_at":"2026-05-13T12:01:42.646453Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.05802","last_updated":"2022-06-14T01:16:24Z","snapshot_observed_at":"2026-07-06T13:19:58.934755Z","submitted_at":"2022-06-12T17:40:53Z","title":"Self-critiquing models for assisting human evaluators","version":2},"cited_work":{"arxiv_id":"2206.05802","doi":"10.48550/arxiv.2206.05802","metadata_source":"pith","pith_arxiv_id":"2206.05802","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-critiquing models for assisting human evaluators","venue":"cs.CL","work_id":"3fcefdd1-22ab-4648-a683-cb1555e7a50e","year":2022},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2206.05802","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:9e318c6757f88773463ac0e045179035213d121f68a25188523c754abeeda4f6","observation_id":"cd30226b-d5df-49ec-b9c9-d52ecdb4ddd9","resolution":{"observed_at":"2026-05-16T20:25:41.981797Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":"2303.17651","doi":"10.1007/s10664-008-","metadata_source":"pith","pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":"cs.CL","work_id":"59181e7f-e58e-45d3-8146-4477a9f53d5a","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:5a5804c0024879b1cfe462ea1c8d97fe98d8722a4ee326ea0bbb7fdff0436a65","observation_id":"944ba9d4-8dff-42ff-bbf9-6744e12ce992","resolution":{"observed_at":"2026-05-13T12:01:42.522298Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f590e03f-c81c-4105-99d7-9bab9660c453","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:b727b89c3ee1eb752f0a8e05d3f5f9718ef6e6fed86d528e84bce2f1b8dd6292","observation_id":"5d7793c5-945d-4384-81b3-b545bf8c11df","resolution":{"observed_at":"2026-05-13T12:01:42.649362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , month =","venue":null,"work_id":"25994dc5-59ca-40ac-90b5-6aab0fd8549d","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:ece631b7a062b023e85ae6331192058e5cb4c3d6971750c2a27dfbe8315703ac","observation_id":"2e3b20d5-15ee-49e4-b670-2681968984bb","resolution":{"observed_at":"2026-05-13T12:01:42.651546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":"2305.14233","doi":"10.48550/arxiv.2305.14233","metadata_source":"pith","pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","venue":"cs.CL","work_id":"5b264119-de53-49d1-b7be-d172bf51c834","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:c1fb9bc70aed3d9c7618ecb6e372547d5336c2215ba49d5a12c6467528cabad5","observation_id":"eb8e6915-5f59-40cf-a93f-5257cf003227","resolution":{"observed_at":"2026-05-15T17:25:08.436185Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:27.379194+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09751","last_updated":"2020-02-14T21:56:30Z","snapshot_observed_at":"2026-07-06T07:47:32.745963Z","submitted_at":"2019-04-22T07:17:18Z","title":"The Curious Case of Neural Text Degeneration","version":2},"cited_work":{"arxiv_id":"1904.09751","doi":"10.48550/arxiv.1904.09751","metadata_source":"pith","pith_arxiv_id":"1904.09751","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Curious Case of Neural Text Degeneration","venue":"cs.CL","work_id":"1ef2ec4a-db7b-42b2-9416-0f1bb628c3c8","year":2019},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1904.09751","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:7e95c6dd075d14ebc9d4486d6e76b5441e4aa082140b509e0ece0f4ce45719d8","observation_id":"3b635495-6310-4e9d-8e82-9a7e81e62345","resolution":{"observed_at":"2026-05-13T12:01:42.559457Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-19T15:54:15.356125+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T15:54:15.356125+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv e-prints , pages=","venue":null,"work_id":"1659b618-d9e3-43b8-bd24-c7effea52a18","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:c50a5503863d5a4e6f38337bc35a7e4efab81b724ab0c5b14aeeffb2e31f23a6","observation_id":"55a05645-df9d-4464-a153-b3b80b675902","resolution":{"observed_at":"2026-05-13T12:01:42.654175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.00133","last_updated":"2020-09-30T22:38:40Z","snapshot_observed_at":"2026-08-01T09:26:19.649537Z","submitted_at":"2020-09-30T22:38:40Z","title":"CrowS-Pairs: A Challenge Dataset for Measuring Social Biases in Masked Language Models","version":1},"cited_work":{"arxiv_id":"2010.00133","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.00133","snapshot_observed_at":"2026-07-03T17:38:44.469211Z","title":"arXiv preprint arXiv:2010.00133 , year=","venue":null,"work_id":"98abd3ca-3f3e-4a42-8d54-3b7d50fe011a","year":2020},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2010.00133","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:b0cb2602734b2e059a9949a06a1c1f1ee133aa9071a8b48e29b117a57ea820a3","observation_id":"a93c8510-cb55-44e1-8637-8e8266c155c7","resolution":{"observed_at":"2026-05-13T12:01:42.380838Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04751","last_updated":"2023-10-30T20:36:20Z","snapshot_observed_at":"2026-08-04T08:05:09.732049Z","submitted_at":"2023-06-07T19:59:23Z","title":"How Far Can Camels Go? Exploring the State of Instruction Tuning on Open Resources","version":2},"cited_work":{"arxiv_id":"2306.04751","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2306.04751","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2306.04751 , year=","venue":null,"work_id":"be09ac68-3260-4c2f-bfcb-1ae1b5717468","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2306.04751","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:6850ff7a79b1619e7085b979de39d01a81085c705c81b582c8aa0cef3b68df98","observation_id":"72a95905-f221-497e-9e5c-f88af0db26c3","resolution":{"observed_at":"2026-05-13T12:01:42.385415Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T11:36:12.790467Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":"b02622aa-75de-4289-92a8-bd2b7de82f38","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:e8812cf30e9cbb6256bb208c10f5d48fc5785de5fb5569f2638e202a1416bcb7","observation_id":"eb703f43-de70-429b-a021-c5c08bb8d600","resolution":{"observed_at":"2026-05-13T12:01:42.656831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-07-06T06:59:57.168051Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":"1809.02789","doi":"10.48550/arxiv.1809.02789","metadata_source":"pith","pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","venue":"cs.CL","work_id":"b9d68fc0-5b23-4def-bc5e-6ad71d64eec6","year":2018},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:991542af462c84af06ce5e37ae391ea30f124cef07bf5ca7593e63e0572e928b","observation_id":"318c89fe-b485-45d8-ba2d-b0110e84726e","resolution":{"observed_at":"2026-05-13T12:01:42.420722Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:b6c26eb3bf550911cb25386e1976e388a4ca69cf22ba973a549f6cdb962c029e","observation_id":"6312acd9-a68e-4fbf-9686-f9e530a27c64","resolution":{"observed_at":"2026-05-13T12:01:42.433928Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , url =","venue":null,"work_id":"2244f9a3-22fb-4578-a247-9601f4b9f65e","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:21df570ac3f283d3869d240c899038d3aa61d633455ff352d9e2d65be99957e5","observation_id":"0076f5d9-fd96-43dc-a896-db3d2a8ee47c","resolution":{"observed_at":"2026-05-13T12:01:42.659359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T14:06:16.663793Z","title":"Thirty-seventh Conference on Neural Information Processing Systems , year=","venue":null,"work_id":"5fb2a5c0-2fa4-4940-995f-db97d9c74c78","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:12dde9473e6fc9ad03bb559e70457c85e0266fbd9ce8b3f6de53467b7c4b4578","observation_id":"38d8faae-22d3-4009-b78d-500213db6a87","resolution":{"observed_at":"2026-05-13T12:01:42.661947Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Twelfth International Conference on Learning Representations , year=","venue":null,"work_id":"f1504da5-c42b-4360-baa5-2120f39d6a12","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:5c1a5ca0b5b80f481015b5b6f611947147dbbe86f026dfaba2b42af38ea3fc38","observation_id":"979de74b-3b4e-4f83-b644-3401c22f9297","resolution":{"observed_at":"2026-05-13T12:01:42.664456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T06:30:44.699380Z","title":"Gonzalez and Ion Stoica , booktitle=","venue":null,"work_id":"850aa26e-3bc1-4119-aba2-b882c04a4c12","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:e1ff46beab4476b5260c052412ac17cfc481f530bb82b7a2c729a875c73f00f7","observation_id":"267b1716-1260-4025-aa8d-b650af90d68e","resolution":{"observed_at":"2026-05-13T12:01:42.667327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T14:17:10.591505Z","title":null,"venue":null,"work_id":"e289a830-ebae-4e9c-816c-e289c5673aa8","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:ed131804dbaabdd75b05d83a55f88bb7a83bd5e62de4c272772ce1acb7d73ac4","observation_id":"81db4109-a291-40aa-8c62-fd54d523033e","resolution":{"observed_at":"2026-05-13T12:01:42.670297Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing data using","venue":null,"work_id":"e9dcfdfe-7f54-4cc2-9479-04ee1b424d7e","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:da24fbc7958310f26701ae8398708c6af440eade1b85240d150b52f2dbd95915","observation_id":"113fe07b-8d74-443a-825f-c8d1106ad10a","resolution":{"observed_at":"2026-05-13T12:01:42.673232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40d0cc69-ef88-4b25-a4f1-0618af203381","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:4443c4b7ace02f62d7caba76c0a87a60d39d50927c23960a25dfa2bb68a96d1b","observation_id":"f3117206-b70b-4fb1-b066-26a5f495d2e6","resolution":{"observed_at":"2026-05-13T12:01:42.676247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":"b202dcb7-0590-4a1b-b41f-72cd5085cc57","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:eb6ee3ce4e7ab8b5f99fea71a82fbf531ea0d1a89e8ac9b033f667700d19c783","observation_id":"1a4f39e1-53b7-42e8-8ba2-8dbe710e112c","resolution":{"observed_at":"2026-05-13T12:01:42.679643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"73415d74-ba8b-4efa-90df-2909c6710c96","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:45420bf0b05e851e287d0a6b36d949a79da6b4e64effbc32e49fe73a4a722778","observation_id":"61554148-4f04-411a-b2b1-9c9c7c779555","resolution":{"observed_at":"2026-05-13T12:01:42.682826Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , url=","venue":null,"work_id":"fa47da22-46e2-4831-bb70-ef12685516d4","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:8d2b46d7cd82aabaca81b324a1bab7377f18237831866e18093a56e7f788d9c2","observation_id":"67b346b2-bd1e-48e5-b27f-5e654ed2b8aa","resolution":{"observed_at":"2026-05-13T12:01:42.686899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Thirty-seventh Conference on Neural Information Processing Systems Datasets and Benchmarks Track , year=","venue":null,"work_id":"83ee0fb0-2d6a-40bb-89d4-935b396e3b1c","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:c7a1c48e0e079646835280e9f50bd1fd8514c09e8502981f9c297d98c6f3ac97","observation_id":"af17cc94-be69-4df7-9715-dd52c6095034","resolution":{"observed_at":"2026-05-13T12:01:42.690354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":"2302.13971","doi":"10.48550/arxiv.2302.13971","metadata_source":"pith","pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LLaMA: Open and Efficient Foundation Language Models","venue":"cs.CL","work_id":"c018fc23-6f3f-4035-9d02-28a2173b2b9d","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:2ce04f62ad4723e3ae7a9619bfc98176da4791125cd536efb609f541ee2bbf13","observation_id":"60f6000e-afc4-4544-ae44-1ac1b3202b15","resolution":{"observed_at":"2026-05-13T12:01:42.532980Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T11:08:05.851253+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 25th International Conference on Machine Learning , pages=","venue":null,"work_id":"b0868b37-4e1d-468d-a012-1cac86ee6bd8","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:0741e66555cfe0814671aabfb5b3601709c0aaab0fa02ef0553bcd98b908f7b9","observation_id":"4dbcd9d2-7203-4380-825d-af05804473e1","resolution":{"observed_at":"2026-05-13T12:01:42.703356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine learning , volume=","venue":null,"work_id":"1b4b06dc-0691-4bbe-afd6-329f6c4f6c05","year":1997},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:6eac1d7faca73d9e89a2cc08110b2c1a24c1e57c1ff0740efe021d0b51193f0c","observation_id":"6b0fc452-10b3-4156-97f4-06fe4158b913","resolution":{"observed_at":"2026-05-13T12:01:42.708423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:57:49.142954Z","title":"OpenAI blog , volume=","venue":null,"work_id":"31dc92c3-2fc3-432b-8d63-b7ee13f53a9c","year":null},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:97c7b91f98d54a204747b8cf5b2905ab076c3368666a9dd9cb4bc7eb3623b0e4","observation_id":"1db4f041-1d64-4170-9258-3463d54c8fee","resolution":{"observed_at":"2026-05-13T12:01:42.711957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:d1dd8b86203b4230ca0536d8573a12eab5101096561e9820bcf705c7ea5c5038","observation_id":"2b56ee4e-a1e1-4214-8842-259d35c94304","resolution":{"observed_at":"2026-05-13T12:01:42.555447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.493","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The CRINGE loss: Learning what language not to model","venue":null,"work_id":"4d74a358-d78e-4c0a-9b45-054f0bf1402e","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:4684eb2d63df1978db38f897026caeb32b6a175cd5e2431c31e5f88ab19e9bdd","observation_id":"7e47feb6-f96a-4fa4-acf1-15dd074e394f","resolution":{"observed_at":"2026-05-13T12:01:42.342416Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:06.915173+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:06.915173+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Claude 2","venue":null,"work_id":"47e2c0ac-376c-4c7b-a9b6-7b21af6e2b99","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:2ccbe2b3cd292862dde64afb2c6c1c1e81c60be71acc1be8578b448a091adb01","observation_id":"37dafee1-c794-4784-8c85-d9ee68b506fc","resolution":{"observed_at":"2026-05-13T12:01:42.714935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":"2204.05862","doi":"10.1016/j.respol.2005.01.014","metadata_source":"pith","pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","venue":"cs.CL","work_id":"a1f2574b-a899-4713-be60-c87ba332656c","year":2022},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:65f5fc5dd479961683616ea5513870413aa3104fb92e26e84f6a262423f11abb","observation_id":"279a7133-f1d4-4e09-8ff2-22512915be9f","resolution":{"observed_at":"2026-05-13T12:01:42.563363Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":"2212.08073","doi":"10.48550/arxiv.2212.08073","metadata_source":"pith","pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Constitutional AI: Harmlessness from AI Feedback","venue":"cs.CL","work_id":"faaaa4e0-2676-4fac-a0b4-99aef10d2095","year":2022},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:20f524ba9ffc57b55dc77085d6052e32fbfc19032b23e9f83a5c4888ba766eb0","observation_id":"3fce83ed-2ffd-4bba-b7a3-4605e7a517f3","resolution":{"observed_at":"2026-05-13T12:01:42.369226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T07:38:15.114855+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking foundation models with language-model-as-an-examiner","venue":null,"work_id":"1c18661f-5737-45b5-9333-cef51325d480","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:6dd1c1c85ced730724f40524decdbed45169cddc3189d8174bfbd3491875463b","observation_id":"3f0f706b-e2db-4877-b4d4-7115fe0dd19e","resolution":{"observed_at":"2026-05-13T12:01:42.722495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"9d696e1e-4281-470f-8bac-fec4a8adfdf4","year":2020},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:762840c442e0d54875a3933a5732ccdd89a8c7f0aa1f0ae53dd2ee5302fb9dcc","observation_id":"4c230694-83eb-4bec-a20b-dfb20451651b","resolution":{"observed_at":"2026-05-13T12:01:42.592439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"AlpaGasus : Training a better alpaca with fewer data","venue":null,"work_id":"64ab4bfa-5df2-4359-a963-4575b1e039b1","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:681fee306189da3024c9eca70f108900eadc621cd9503d1017479e0156a9483a","observation_id":"9c103a83-b4f7-4d84-8aea-f09699b7c539","resolution":{"observed_at":"2026-05-13T12:01:42.730778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-07-06T17:10:56.398607Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":"2401.01335","doi":"10.48550/arxiv.2401.01335","metadata_source":"pith","pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","venue":"cs.LG","work_id":"6b7f0773-4e99-4274-9d8e-279a1f25c5e1","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:4f42fc5f7010cfcb1b7bfdf3db90db187c732c29949071c3e542aae38cf0d4cf","observation_id":"7d47b342-7b40-4b9c-ade3-65f777a95b5c","resolution":{"observed_at":"2026-05-14T23:00:22.024625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":"1803.05457","doi":"10.1162/tacl_a_00448.https://aclanthology.org/2022.tacl-1.5","metadata_source":"pith","pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","venue":"cs.AI","work_id":"28ea1282-d657-4c61-a83c-f1249be6d6b1","year":2018},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:75eed040c06c5d97c62eafffae0567ca275f72eb691a2c2cf3d9f79337daacc5","observation_id":"226a7d65-ffa5-4f6e-8a4a-42f636bdb605","resolution":{"observed_at":"2026-05-13T12:01:42.395007Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:6ab3a10276b8493876da6d17fd7aa9ca5310410672c4340a58b5c8cbcc83b9ed","observation_id":"e46a2f2d-c1f5-45d5-816e-90e4bc1f6f57","resolution":{"observed_at":"2026-05-13T12:01:42.400273Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A unified architecture for natural language processing: Deep neural networks with multitask learning","venue":null,"work_id":"21c75690-00af-49dd-9127-61008599387b","year":2008},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:95a466df0c9fa5abbfd8433adeaf05ee9e2cb95bd9c21866f840f9779b9d6814","observation_id":"c595846b-de6b-4f54-897a-edc878437d05","resolution":{"observed_at":"2026-05-13T12:01:42.734598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14387","last_updated":"2024-01-08T04:46:56Z","snapshot_observed_at":"2026-07-06T15:31:51.249701Z","submitted_at":"2023-05-22T17:55:50Z","title":"AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback","version":4},"cited_work":{"arxiv_id":"2305.14387","doi":"10.48550/arxiv.2305.14387","metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14387","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Yann Dubois, Xuechen Li, Rohan Taori, Tianyi Zhang, Ishaan Gulrajani, Jimmy Ba, Carlos Guestrin, Percy Liang, and Tatsunori B Hashimoto","venue":"arXiv (Cornell University)","work_id":"a875adf2-8826-466d-bf52-896ee15632ea","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2305.14387","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:f41ea97d88b730c80a1cf94f41a0eab2194a850fc894734b87204f46d8be41fd","observation_id":"650f1700-58a3-4bc1-8196-94d98ab8091e","resolution":{"observed_at":"2026-05-13T12:01:42.411055Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.wmt-1.100","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Devil Is in the Errors: Leveraging Large Language Models for Fine-grained Machine Translation Evaluation","venue":null,"work_id":"e69f523f-0741-461d-9293-daed8a6eb479","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:0678a0a1d33439d4e31440b2f449d0cde545156248543e0bbbfc345ba13cfbc4","observation_id":"40c30f43-a60e-4da2-9bfb-2b749953fefb","resolution":{"observed_at":"2026-05-13T12:01:42.359868Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-21T06:52:41.698418+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-21T06:52:41.698418+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08998","last_updated":"2023-08-21T10:23:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-17T14:12:48Z","title":"Reinforced Self-Training (ReST) for Language Modeling","version":2},"cited_work":{"arxiv_id":"2308.08998","doi":"10.1126/sciadv.abg6611","metadata_source":"pith","pith_arxiv_id":"2308.08998","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Reinforced Self-Training (ReST) for Language Modeling","venue":"cs.CL","work_id":"db054f5c-62a3-405b-aae8-43e02c39f672","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2308.08998","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:8907b607e822774a02baae3fa2de5751e0c02528f3b6dbc6905f6d7e571f2cc5","observation_id":"fac3085a-c512-4da3-bb82-1aeb948c1407","resolution":{"observed_at":"2026-05-13T12:01:42.415914Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"7abb23c2-9bf1-4a4d-a918-13f89e5d9904","year":2021},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:54356d196a9c82113bbca409491f5020366083538d427c72e3554f3c04530292","observation_id":"f0c6dc93-5c2c-47b6-a2d7-f58b65dc8000","resolution":{"observed_at":"2026-05-13T12:01:42.738256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.806","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unnatural Instructions: Tuning Language Models with (Almost) No Human Labor","venue":null,"work_id":"fd78a879-4e73-4c03-9634-fa7124642de2","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:dbb325f9ecbfda7568b827b42b81a36f6b6800552a0b89f13f65566ce8bc435d","observation_id":"255488b6-6486-47df-8b8e-fe4ecff2c815","resolution":{"observed_at":"2026-05-13T12:01:42.364245Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08491","last_updated":"2024-03-09T10:44:58Z","snapshot_observed_at":"2026-07-06T16:32:00.957275Z","submitted_at":"2023-10-12T16:50:08Z","title":"Prometheus: Inducing Fine-grained Evaluation Capability in Language Models","version":2},"cited_work":{"arxiv_id":"2310.08491","doi":"10.48550/arxiv.2310.08491","metadata_source":"pith","pith_arxiv_id":"2310.08491","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prometheus: Inducing fine-grained evaluation capability in language models","venue":"cs.CL","work_id":"1a2ffbb6-db38-45ca-8c3b-8408254fb19b","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2310.08491","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:b8e711fc4af1b9980119c7697b156dba6e470b701ebdb71b7f9ade3aa39ad66a","observation_id":"027108b2-b368-4f88-889c-94b34120d6c1","resolution":{"observed_at":"2026-05-13T12:01:42.426442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07327","last_updated":"2023-10-31T11:38:07Z","snapshot_observed_at":"2026-07-06T15:15:53.807406Z","submitted_at":"2023-04-14T18:01:29Z","title":"OpenAssistant Conversations -- Democratizing Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":"2304.07327","doi":"10.48550/arxiv.2304.07327","metadata_source":"arxiv_reference","pith_arxiv_id":"2304.07327","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"R., Stevens, K., Barhoum, A., Duc, N","venue":"arXiv (Cornell University)","work_id":"34ddaebd-853b-4596-b47d-a42b9340305e","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2304.07327","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:63fd3b156ec329a4c0a40e7da8e703466cdffbd5e491affb523d20ba6e76cca3","observation_id":"5e117b42-fa35-4fe3-976c-c8c37299e9cc","resolution":{"observed_at":"2026-05-13T12:01:42.430273Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toutanova, Llion Jones, Ming-Wei Chang, Andrew Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":"da4767ea-1362-4aef-be3c-2271342e9aef","year":2019},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:f80b2d04f7f9d251e1d67190689d363c76f2cc0e664739a7069f11dd52941db3","observation_id":"938c560b-6c88-41b8-ab7e-b24082894ade","resolution":{"observed_at":"2026-05-13T12:01:42.742548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":"2309.00267","doi":"10.48550/arxiv.2309.00267","metadata_source":"pith","pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","venue":"cs.CL","work_id":"81d8781d-2933-4e89-97ee-9bbfc6d4ca0c","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:99bb83d7f01055b831e86d83672bf2a13e2926d064c7e6d0c0f614ca4e2dd25c","observation_id":"1703f623-039c-4602-998e-9b96a625b743","resolution":{"observed_at":"2026-05-15T21:32:28.362135Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T14:25:05.545533+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-alignment with instruction backtranslation","venue":null,"work_id":"e18bec74-debb-48fe-b49e-3b1ccc331249","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:387fa8846fbf2a4869f4b4ccca4c82f69534688189041aae24e2ef24aea32dea","observation_id":"76b75438-d0c9-4048-abf9-dcd6f057f7a3","resolution":{"observed_at":"2026-05-13T12:01:42.746109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashimoto","venue":null,"work_id":"885dc18a-4cbf-4307-b726-a7adda854b61","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:5c439e3a1b7ca912a31bc566768d42f0cc28de7ccee1ce10e54d141cbcf92650","observation_id":"23e4108e-751c-4857-9eed-cc753150129c","resolution":{"observed_at":"2026-05-13T12:01:42.767942Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"ROUGE : A package for automatic evaluation of summaries","venue":null,"work_id":"fe78a743-da36-4590-ba58-4cb237960843","year":2004},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:8e801fd74ff272ece0f3d96ae990338df6e138826a9ebb68c99cfdf5b68731e3","observation_id":"1b866eb6-2d81-42e0-be46-b9554cd7985c","resolution":{"observed_at":"2026-05-13T12:01:42.773998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T12:46:15.045882Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":"efba341e-9173-426f-928c-b9aa410afbee","year":2018},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":107,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:99913fd9f94d6d859cefad724fab5604ea0e3ba16874c7e0634f434581f1bfd2","observation_id":"5142f443-50db-45a3-a6c3-f960cc0b8358","resolution":{"observed_at":"2026-05-13T12:01:42.777821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"419d5fd7-fcec-439f-b29a-d31dcb6533dc","year":2022},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":108,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:2793f5df3280002d035e51dcb06e08d3e0951e2e0b9b0c532c59bec934626db4","observation_id":"5f8a03f5-922c-48a2-b2af-b1c2a79ac6ab","resolution":{"observed_at":"2026-05-13T12:01:42.566640Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03188","last_updated":"2023-08-30T03:47:34Z","snapshot_observed_at":"2026-07-06T16:03:10.517945Z","submitted_at":"2023-08-06T18:38:52Z","title":"Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies","version":2},"cited_work":{"arxiv_id":"2308.03188","doi":"10.48550/arxiv.2308.03188","metadata_source":"arxiv_reference","pith_arxiv_id":"2308.03188","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Automatically correcting large language models: Surveying the landscape of diverse self-correction strategies","venue":"arXiv (Cornell University)","work_id":"e2a8a654-4e0d-4c6b-8c00-d9bf069b8722","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2308.03188","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:b3ac58ef5e3a094c789cbf4fec80462cd9040390ed6a65dec4d84df5758f949d","observation_id":"6fc8b0e2-3af5-4882-b55f-9c25c10421cd","resolution":{"observed_at":"2026-05-13T12:01:42.468060Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T03:37:47.112566Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"175d0d95-85f4-480c-b6d3-53a7e52df1e4","year":2019},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:52875df457d2e57a9e84f1bb9614a53de65980ccfcd9bd335d830b62410efe02","observation_id":"597a14cc-3aa2-40bc-9927-a695fd3ebd26","resolution":{"observed_at":"2026-05-13T12:01:42.570093Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":"3aa9511f-952a-4d90-9be7-575692365da8","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:e4f9ab44c16a316035da0fbb50b7d0cccf64336673869cd9da85b3fe9134c8d1","observation_id":"0bfc952c-61d4-4ffe-885e-17984c4e86b0","resolution":{"observed_at":"2026-05-13T12:01:42.573340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15123","last_updated":"2024-06-07T16:08:49Z","snapshot_observed_at":"2026-07-06T16:37:19.963994Z","submitted_at":"2023-10-23T17:29:48Z","title":"Branch-Solve-Merge Improves Large Language Model Evaluation and Generation","version":2},"cited_work":{"arxiv_id":"2310.15123","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.15123","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Branch-solve-merge improves large language model evaluation and generation","venue":null,"work_id":"3d0f6840-34e6-47b0-a438-fcd883d483bc","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2310.15123","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:a1e5b96428adc01d7d2a8e9b23c766047fbda0a3867278b6897fd1b9af96b308","observation_id":"13dbc281-ed12-4238-b341-4b8a4c0eb765","resolution":{"observed_at":"2026-05-13T12:01:42.482991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":"1904.09728","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-07-08T01:44:26.198243Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","venue":"cs.CL","work_id":"3f93670e-0ae7-40e5-bed5-74c216638dd1","year":2019},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:51b53dae53924eb9d386627bcdef6167a8d0510c524b92f0958cf79e5972b3ae","observation_id":"088bd612-4aa5-4c4b-b45a-d8bc5861ae84","resolution":{"observed_at":"2026-05-13T12:22:26.192007Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":114,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:9f6e6a5b1f727d2ed17657dd324f17e85b9ad2b4f67431ce3d37f2f88370d4cb","observation_id":"02e2bcbc-c53a-4f8f-b30f-f535d39c9082","resolution":{"observed_at":"2026-05-13T12:01:42.490790Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning to summarize with human feedback","venue":null,"work_id":"f3128207-ff85-4ff8-b2cd-22957db36425","year":2020},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:bacaad8948d8869eac009bdb7c45d0806f5a7645a80318478a7ae388d56df041","observation_id":"9a7d8f85-8216-48fd-9e80-24998d0c5188","resolution":{"observed_at":"2026-05-13T12:01:42.576691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:55:53.827539Z","title":"Hashimoto","venue":null,"work_id":"35104f7e-ffc3-488e-b66a-a4d3d230e657","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:ed320d19171f538c64d3de537df002c1c6402d3fcec8b94a4564cfb501e34ccb","observation_id":"e7a2d0cb-808e-483c-8e33-de3d0441bf7b","resolution":{"observed_at":"2026-05-13T12:01:42.579741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":117,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:6a961cb8704bdf5d9c93c6273ebf4853fee0edefd1a0b5d2c7883bae9f5f83ec","observation_id":"f70294a5-f8e1-41c3-bdce-ad929aefd96a","resolution":{"observed_at":"2026-05-13T12:01:42.503076Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visualizing data using t-SNE","venue":null,"work_id":"e1952e37-3f4d-43b6-a99c-9737d0beff82","year":2008},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":118,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:7ea415c21ce659d863001d4b9b41970f3e3d82835db6f3bb4cd8925b2edb8e68","observation_id":"dc17169d-6b90-404d-9479-58691c9bb72d","resolution":{"observed_at":"2026-05-13T12:01:42.582928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.754","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"77998c0b-6219-401e-8e31-21cbe010da99","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":119,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:f996adaaa00fd966ca16d7be145082aa715112267558836313bc3d09b18a269c","observation_id":"542183c1-5c4d-405c-ae3d-19d037588e8f","resolution":{"observed_at":"2026-05-13T12:01:42.351649Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T10:52:46.628439+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T10:52:46.628439+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11456","last_updated":"2024-05-01T14:50:56Z","snapshot_observed_at":"2026-08-02T03:59:22.576409Z","submitted_at":"2023-12-18T18:58:42Z","title":"Iterative Preference Learning from Human Feedback: Bridging Theory and Practice for RLHF under KL-Constraint","version":4},"cited_work":{"arxiv_id":"2312.11456","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.11456","snapshot_observed_at":"2026-07-03T08:07:45.294768Z","title":"Iterative preference learning from human feedback: Bridging theory and practice for rlhf under kl-constraint.arXiv preprint arXiv:2312.11456","venue":null,"work_id":"a7265aa9-5ce8-4a96-acfd-3f069003f21d","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":120,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2312.11456","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:8c8c335046658edebefd14a714cc6dfb4cae4bda7eb00bc531eb52532c596d51","observation_id":"be79fbfa-d555-494a-8c4a-1fae5e1094ea","resolution":{"observed_at":"2026-05-13T12:01:42.513253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-07-06T17:09:02.167931Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":"2312.16682","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-07-04T00:29:16.737553Z","title":"Rui Yang, Ruomeng Ding, Yong Lin, Huan Zhang, and Tong Zhang","venue":null,"work_id":"82c78c41-62c3-4eb5-b38d-0263edfb7f2e","year":2024},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":121,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:537fea74fb23a66852f31633b44956ce4b9fff4369645d463f1d23c17c1e76bc","observation_id":"bdd04f55-6a75-4367-b275-0d6bb227348b","resolution":{"observed_at":"2026-05-13T12:01:42.518264Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RRHF : Rank responses to align language models with human feedback","venue":null,"work_id":"9d966c89-f5f3-4445-b606-d75b44e7a8a4","year":2023},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:11052f242df5d3d208e93789106f44a2c2e2ffd13c21edaf6a94f2cbf611a690","observation_id":"87ecf850-2d3c-4cb1-b334-e4ba3f24daf1","resolution":{"observed_at":"2026-05-13T12:01:42.586588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/p19-1472","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T12:07:03.406813Z","title":"URL https:// doi.org/10.18653/v1/p19-1472","venue":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics","work_id":"11bfc949-547c-40f3-a86d-953eb9b2154c","year":2019},"citing_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"reference_index":123,"source":"arxiv_source","source_observed_at":"2026-05-13T12:01:42.290502Z"},"links":{"citing_paper":"/paper/2401.10020"},"observation_digest":"sha256:5bb041819d21c4abce0d05596dacfb1ec062730f06afe96113c3591a714ac669","observation_id":"9d7f4113-d9d8-4e29-a26f-e2e1170e3243","resolution":{"observed_at":"2026-05-13T12:01:42.347297Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.023254+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":22,"parse_uncertain":0,"unresolved":6,"verified_exact":23,"verified_fuzzy":49},"total_outbound_references":104},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 100 of 104 outbound references and 87 inbound Pith citation observations for arXiv:2401.10020."}