{"as_of":"2026-08-09T16:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:47cbe9771a1d051701602338655f40d57f16b0a259db32a1112de1e0e99b2963","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":10,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":10,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":10,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":10,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T22:27:11.518340Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T01:17:30.387482Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-08T22:27:11.518340Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.04567","last_updated":"2025-02-06T23:45:08Z","snapshot_observed_at":"2026-08-08T23:18:49.554514Z","submitted_at":"2025-02-06T23:45:08Z","title":"Preference Optimization via Contrastive Divergence: Your Reward Model is Secretly an NLL Estimator","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-08T22:27:11.518340Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2502.04567"},"observation_digest":"sha256:95158ca8c3ac50b35dd0e899ea0ad1ec74584054b08ec489ec90f2929650c838","observation_id":"14537d1c-3b73-45bc-a6d9-917caa9cc877","resolution":{"observed_at":"2026-08-08T22:27:11.518340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-08T04:58:33.868928Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing.arXiv preprint arXiv:2406.05534, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.08489","last_updated":"2025-02-13T17:33:24Z","snapshot_observed_at":"2026-08-08T14:38:41.643106Z","submitted_at":"2025-02-12T15:26:08Z","title":"Salamandra Technical Report","version":2},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-08T04:58:33.868928Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2502.08489"},"observation_digest":"sha256:3c3c79fd7228a64717de64a43c630a403af8fd2872fa5f599461c775086eae0d","observation_id":"433f1a7c-75d5-46e2-820b-a19450e9d175","resolution":{"observed_at":"2026-08-08T04:58:33.868928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-07T12:03:49.727328Z","title":"Biqing Qi, Pengfei Li, Fangyuan Li, Junqi Gao, Kaiyan Zhang, and Bowen Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00780","last_updated":"2025-06-01T02:15:17Z","snapshot_observed_at":"2026-08-07T11:55:46.849084Z","submitted_at":"2025-06-01T02:15:17Z","title":"Do not Abstain! Identify and Solve the Uncertainty","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T12:03:49.727328Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2506.00780"},"observation_digest":"sha256:679c50a5d3a2ae9b6554a844c92f72f0e17f387302e0330b3e05d8db624e8a2c","observation_id":"708f84de-c075-4007-ac47-454f2cf4c6e4","resolution":{"observed_at":"2026-08-07T12:03:49.727328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-06T20:55:26.559009Z","title":"arXiv preprint arXiv:2406.05534 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01479","last_updated":"2025-07-02T08:43:06Z","snapshot_observed_at":"2026-08-07T09:50:42.126653Z","submitted_at":"2025-07-02T08:43:06Z","title":"Evaluating the Effectiveness of Direct Preference Optimization for Personalizing German Automatic Text Simplifications for Persons with Intellectual Disabilities","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T20:55:26.559009Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2507.01479"},"observation_digest":"sha256:b2312087f2efcab48c98f85b561befd3295cfdc2f0285a8bfac7861ba2e762f5","observation_id":"1b87ab13-8601-4918-857f-42e1daca9835","resolution":{"observed_at":"2026-08-06T20:55:26.559009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-06T10:28:56.164873Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing.arXiv preprint arXiv:2406.05534, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23779","last_updated":"2025-07-31T17:59:09Z","snapshot_observed_at":"2026-08-08T14:45:38.446269Z","submitted_at":"2025-07-31T17:59:09Z","title":"Phi-Ground Tech Report: Advancing Perception in GUI Grounding","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T10:28:56.164873Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2507.23779"},"observation_digest":"sha256:62047b5ba3b0e1c735658e01931d37a88c6ed82371bdaac25a9fce2da0c711ff","observation_id":"fa140b0e-9a8c-4b3a-9fd7-c0f48c8c0439","resolution":{"observed_at":"2026-08-06T10:28:56.164873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-04T18:48:57.769300Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10575","last_updated":"2025-09-11T17:14:08Z","snapshot_observed_at":"2026-08-08T08:10:00.312684Z","submitted_at":"2025-09-11T17:14:08Z","title":"Gene-R1: Reasoning with Data-Augmented Lightweight LLMs for Gene Set Analysis","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T18:48:57.769300Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2509.10575"},"observation_digest":"sha256:df59b52469d666b0546fc6337c37e4675e667557568a93a4547d8869cba34a8b","observation_id":"e8130233-b89f-4f30-ba84-b90345c91fb6","resolution":{"observed_at":"2026-08-04T18:48:57.769300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":"2406.05534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-07-03T01:17:30.387482Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing.arXiv preprint arXiv:2406.05534","venue":null,"work_id":"67698921-3d05-4e9d-a33f-3a04296b5942","year":2024},"citing_paper":{"arxiv_id":"2604.07941","last_updated":"2026-04-16T04:43:04Z","snapshot_observed_at":"2026-08-02T07:24:04.075021Z","submitted_at":"2026-04-09T08:00:37Z","title":"Large Language Model Post-Training: A Unified View of Off-Policy and On-Policy Learning","version":2},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-05-10T18:28:58.515666Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2604.07941"},"observation_digest":"sha256:0f779c6f520e79efc6b352769add8da1fab72106599c937278aaae0943f9ba3b","observation_id":"e3ae8dbc-d63f-48d6-a867-279e600ec9ad","resolution":{"observed_at":"2026-05-11T00:30:53.842108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":"2406.05534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-07-03T01:17:30.387482Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing.arXiv preprint arXiv:2406.05534","venue":null,"work_id":"67698921-3d05-4e9d-a33f-3a04296b5942","year":2024},"citing_paper":{"arxiv_id":"2605.05040","last_updated":"2026-05-06T15:31:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-06T15:31:50Z","title":"Preference-Based Self-Distillation: Beyond KL Matching via Reward Regularization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T16:22:46.913172Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2605.05040"},"observation_digest":"sha256:ca32e33e3a58f40b3f06d04f58b50d5ab5e5f3b984357d54c02d57bc468fe6d2","observation_id":"c8adf3e0-6aa8-4421-ba5c-f644bfdc0e22","resolution":{"observed_at":"2026-05-11T18:16:10.962351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":"2406.05534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-07-03T01:17:30.387482Z","title":"Online dpo: Online direct preference optimization with fast-slow chasing.arXiv preprint arXiv:2406.05534","venue":null,"work_id":"67698921-3d05-4e9d-a33f-3a04296b5942","year":2024},"citing_paper":{"arxiv_id":"2606.09255","last_updated":"2026-06-08T09:27:55Z","snapshot_observed_at":"2026-08-06T20:54:40.924304Z","submitted_at":"2026-06-08T09:27:55Z","title":"RPO-PDT: Demonstrating Role-Play-Based Knowledge Adaptation for Student Support Dialogue (Demonstration System)","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-27T16:45:27.352655Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2606.09255"},"observation_digest":"sha256:9e0bed175b6390a9c6ed072e2c318b5e3d90e21a53a2357b08039e3bc7e619e4","observation_id":"44fa5945-8ebe-40ea-a314-e28e646912c4","resolution":{"observed_at":"2026-07-03T01:17:30.389257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05534","snapshot_observed_at":"2026-08-01T07:28:36.362432Z","title":"arXiv preprint arXiv:2406.05534 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-03T14:01:50.133228Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":179,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:36.362432Z"},"links":{"cited_paper":"/paper/2406.05534","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:b20f0e0db738e567f1858133c640f2dd763fb1f4a055637b05d26eeb157b1701","observation_id":"3bebc50f-93a1-44a5-b1fc-32a2ce506455","resolution":{"observed_at":"2026-08-01T07:28:36.362432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2406.05534/citation-record","integrity":"/paper/2406.05534/integrity","json":"/paper/2406.05534/citation-record.json","paper":"/paper/2406.05534"},"outbound":[],"paper":{"arxiv_id":"2406.05534","last_updated":"2024-06-08T17:30:54Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T18:27:36.903877Z","submitted_at":"2024-06-08T17:30:54Z","title":"Online DPO: Online Direct Preference Optimization with Fast-Slow Chasing"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 10 inbound Pith citation observations for arXiv:2406.05534."}