{"as_of":"2026-08-04T09:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3af6ac2afb6db4f14bd25ca927d987e0e491796c604d39aec7583307301fa4cd","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":9,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":9,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T23:33:49.468251Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:02:33.817155Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2508.06412","last_updated":"2026-05-07T07:25:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-08T15:56:49Z","title":"Sample-efficient LLM Optimization with Reset Replay","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T23:38:08.044450Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2508.06412"},"observation_digest":"sha256:a6ce16e0d1651ceda1cb488c97b6d29f08751642b04e63d89a73d457a396ddaa","observation_id":"e2d8a1c9-c418-4448-bdfa-652d2a27dfff","resolution":{"observed_at":"2026-05-18T23:41:54.738087Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-03T23:33:49.468251Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.05385","last_updated":"2026-07-23T06:36:18Z","snapshot_observed_at":"2026-08-04T04:34:49.292424Z","submitted_at":"2025-11-07T16:08:34Z","title":"TeaRAG: A Token-Efficient Agentic Retrieval-Augmented Generation Framework","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-03T23:33:49.468251Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2511.05385"},"observation_digest":"sha256:8e0a171e48473fba5ae800c81bae7512168a5a72a4e0600863d112b8dd2f8c3d","observation_id":"921189dd-55a7-47c7-8c07-88391aa3e3ff","resolution":{"observed_at":"2026-08-03T23:33:49.468251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-08-03T05:49:25.124148Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation.arXiv preprint arXiv:2503.12854,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.01357","last_updated":"2026-06-08T05:19:57Z","snapshot_observed_at":"2026-08-03T05:49:22.620202Z","submitted_at":"2026-02-01T17:50:59Z","title":"Your Self-Play Algorithm is Secretly an Adversarial Imitator: Understanding LLM Self-Play through the Lens of Imitation Learning","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T05:49:25.124148Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2602.01357"},"observation_digest":"sha256:dfbff881700b51679970aee3e386d41852b7b28925a17880dd9f799d94c0ae28","observation_id":"ae29fb2c-7c16-4ba5-b2d9-2e85298977f4","resolution":{"observed_at":"2026-08-03T05:49:25.124148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2604.20933","last_updated":"2026-04-22T11:52:21Z","snapshot_observed_at":"2026-07-30T07:55:19.034385Z","submitted_at":"2026-04-22T11:52:21Z","title":"IRIS: Interpolative R\\'enyi Iterative Self-play for Large Language Model Fine-Tuning","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T01:15:12.985803Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2604.20933"},"observation_digest":"sha256:254698998b50f9196490d6bbcc5ef68533d86b63352f903c24646b53e3e36a25","observation_id":"aa1fc4f7-5128-4fc3-9ee6-e1f725596d84","resolution":{"observed_at":"2026-05-11T13:41:05.074027Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2604.23809","last_updated":"2026-04-26T17:13:17Z","snapshot_observed_at":"2026-07-06T23:09:58.193241Z","submitted_at":"2026-04-26T17:13:17Z","title":"LegalDrill: Diagnosis-Driven Synthesis for Legal Reasoning in Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-08T06:06:53.959061Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2604.23809"},"observation_digest":"sha256:f1e99b7227415e41098d17d8c5928e8cff9c526075eb4abfcf7a67a2ce43d347","observation_id":"41a09afb-bd6c-4ae4-bfab-0ba069dbc723","resolution":{"observed_at":"2026-05-11T21:16:25.953549Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2605.07353","last_updated":"2026-05-08T07:08:25Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:08:25Z","title":"Confidence-Aware Alignment Makes Reasoning LLMs More Reliable","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-11T02:10:40.020460Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2605.07353"},"observation_digest":"sha256:dc2ee6251837f795015d44d0be7c3450965e18257f531ae19ef9136f69c1ec98","observation_id":"fd439143-50f9-432f-86e7-ec30bd916e06","resolution":{"observed_at":"2026-05-11T03:55:53.895403Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2605.21266","last_updated":"2026-05-20T14:53:43Z","snapshot_observed_at":"2026-07-06T23:31:46.877766Z","submitted_at":"2026-05-20T14:53:43Z","title":"How Much Online RL is Enough? Informative Rollouts for Offline Preference Optimization in RLVR","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-21T06:22:55.286281Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2605.21266"},"observation_digest":"sha256:06d0cb15114c82e66187d547d3380d2a6f83ad8828db44dbdda7dc139b1b5877","observation_id":"8c53353d-3041-44a5-9005-e0d8f5f1affb","resolution":{"observed_at":"2026-05-21T06:24:00.555652Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2605.23398","last_updated":"2026-05-22T09:11:20Z","snapshot_observed_at":"2026-08-02T13:58:02.707128Z","submitted_at":"2026-05-22T09:11:20Z","title":"TPMM-DPO: Trajectory-aware Preference-guided Model Merging for Iterative Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-25T03:41:52.859647Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2605.23398"},"observation_digest":"sha256:d8b747670ca5f79c6d72f3fb1026aa9c2e30374eb413165d4e027c8b0caedb55","observation_id":"173be850-c0a6-47df-9987-16f2e2589fb1","resolution":{"observed_at":"2026-05-25T03:45:17.528307Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation","version":3},"cited_work":{"arxiv_id":"2503.12854","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.12854","snapshot_observed_at":"2026-06-28T19:02:33.817155Z","title":"Enhancing llm reasoning with iterative dpo: A comprehensive empirical investigation","venue":null,"work_id":"ea5b95ba-1ed2-4602-910d-5bbbda341aab","year":2025},"citing_paper":{"arxiv_id":"2606.00869","last_updated":"2026-05-30T19:53:19Z","snapshot_observed_at":"2026-08-01T18:48:30.860504Z","submitted_at":"2026-05-30T19:53:19Z","title":"Enhancing LLM Metacognition via Cognitive Pairwise Training","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T19:01:18.153145Z"},"links":{"cited_paper":"/paper/2503.12854","citing_paper":"/paper/2606.00869"},"observation_digest":"sha256:4215219d2d902eda875982d117463b1c55a4d7eafcc6ae5e2a0e3ea794ea40b9","observation_id":"a6ce62f4-2f0c-435d-9727-edc4d7977589","resolution":{"observed_at":"2026-06-28T19:02:33.820741Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2503.12854/citation-record","integrity":"/paper/2503.12854/integrity","json":"/paper/2503.12854/citation-record.json","paper":"/paper/2503.12854"},"outbound":[],"paper":{"arxiv_id":"2503.12854","last_updated":"2025-07-28T17:46:50Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T20:53:41.124209Z","submitted_at":"2025-03-17T06:28:25Z","title":"Enhancing LLM Reasoning with Iterative DPO: A Comprehensive Empirical Investigation"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 9 inbound Pith citation observations for arXiv:2503.12854."}