{"as_of":"2026-08-20T15:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:91f6512eb5d126c2533bb13a28c358ba955a86f7e1505c4a1d6b0fab36baed9e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":39,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:19:43.539104Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T10:48:02.074671Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2408.15339","last_updated":"2026-05-07T20:32:48Z","snapshot_observed_at":"2026-08-13T05:00:40.483897Z","submitted_at":"2024-08-27T18:04:07Z","title":"UNA: A Unified Supervised Framework for Efficient LLM Alignment Across Feedback Types","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T21:22:36.970101Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2408.15339"},"observation_digest":"sha256:e9580fd396ed5f04afd0ff3a58539c28eaa17a39b4137ab0604680dfc9efcd54","observation_id":"078580d8-a1a5-4ca6-b1db-d8247483d942","resolution":{"observed_at":"2026-05-23T21:23:27.487999Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-12T17:15:47.958038Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12843","last_updated":"2024-11-19T20:17:04Z","snapshot_observed_at":"2026-08-17T01:00:48.700288Z","submitted_at":"2024-11-19T20:17:04Z","title":"Reward Modeling with Ordinal Feedback: Wisdom of the Crowd","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T17:15:47.958038Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2411.12843"},"observation_digest":"sha256:0b65a81253724d89c9bc130c174153cdf1230f68f9e714358bbb1be9e68d2c0a","observation_id":"ba846ef6-2e07-4e29-a80a-bb825c1e5a78","resolution":{"observed_at":"2026-08-12T17:15:47.958038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-12T05:43:32.080953Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19943","last_updated":"2025-01-13T06:53:56Z","snapshot_observed_at":"2026-08-20T03:46:40.707829Z","submitted_at":"2024-11-29T18:58:22Z","title":"Critical Tokens Matter: Token-Level Contrastive Estimation Enhances LLM's Reasoning Capability","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T05:43:32.080953Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2411.19943"},"observation_digest":"sha256:c5ff225528aae4251c9e00fe5447f83d0c400f4c0feb948ac42405ad0ef57537","observation_id":"412575e6-f16c-4f16-b4a6-be6655f7d600","resolution":{"observed_at":"2026-08-12T05:43:32.080953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-11T23:15:56.448673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.02685","last_updated":"2024-12-03T18:56:07Z","snapshot_observed_at":"2026-08-12T01:39:13.359412Z","submitted_at":"2024-12-03T18:56:07Z","title":"T-REG: Preference Optimization with Token-Level Reward Regularization","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T23:15:56.448673Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2412.02685"},"observation_digest":"sha256:73262dab6967078c655eaa20fbf3fb4d8a3eaa21c0a5f633513e611931454e7e","observation_id":"44648541-cb76-49be-8203-d9cce74a5e55","resolution":{"observed_at":"2026-08-11T23:15:56.448673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-11T12:16:31.898358Z","title":"Token- level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.14516","last_updated":"2024-12-19T04:31:56Z","snapshot_observed_at":"2026-08-15T23:47:47.627897Z","submitted_at":"2024-12-19T04:31:56Z","title":"Cal-DPO: Calibrated Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T12:16:31.898358Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2412.14516"},"observation_digest":"sha256:dd2212df453661787841dcce2058c57f0ba6da2ac5725d657205cbc5ffc4fc83","observation_id":"df554fa1-4c4e-4e47-8839-3d33f48fea7a","resolution":{"observed_at":"2026-08-11T12:16:31.898358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-10T22:28:56.807793Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01821","last_updated":"2025-02-27T05:42:17Z","snapshot_observed_at":"2026-08-19T19:29:47.237565Z","submitted_at":"2025-01-03T14:09:46Z","title":"SDPO: Segment-Level Direct Preference Optimization for Social Agents","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:28:56.807793Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2501.01821"},"observation_digest":"sha256:21a868068dbf9136e2409db2f9379bdffb0d43362ed617befa77d3d48be7895d","observation_id":"5614f044-9ccb-4a5a-902d-271b8ddd9c13","resolution":{"observed_at":"2026-08-10T22:28:56.807793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-08T18:10:53.442993Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.05773","last_updated":"2025-07-24T22:59:42Z","snapshot_observed_at":"2026-08-17T04:53:19.281748Z","submitted_at":"2025-02-09T04:31:30Z","title":"PIPA: Preference Alignment as Prior-Informed Statistical Estimation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T18:10:53.442993Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2502.05773"},"observation_digest":"sha256:e827b9a72bf5bfb3767ccd51e7010ffa7dbe92a0a8f69d4f5397cf50fd8c71f4","observation_id":"404700b7-9a2b-4d46-9a65-bf8dc02287f0","resolution":{"observed_at":"2026-08-08T18:10:53.442993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-16T12:19:43.539104Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.13122","last_updated":"2025-04-17T17:39:41Z","snapshot_observed_at":"2026-08-17T12:45:16.433408Z","submitted_at":"2025-04-17T17:39:41Z","title":"VistaDPO: Video Hierarchical Spatial-Temporal Direct Preference Optimization for Large Video Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:19:43.539104Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2504.13122"},"observation_digest":"sha256:55cf2b296871712a1fd181b05e8e9358dffa2cb94660aeb79e3e41257f987a97","observation_id":"10e4deab-3929-4688-bbd8-84862fb74085","resolution":{"observed_at":"2026-08-16T12:19:43.539104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-16T04:18:40.424127Z","title":"Token- level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-18T21:42:55.713614Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.424127Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:2dff91565024c477552c674ee5742735f101227e9bd2b63673e7dd3a445e2105","observation_id":"5cd4cba5-630c-4b7c-9577-6982d9e9e87a","resolution":{"observed_at":"2026-08-16T04:18:40.424127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-16T00:52:06.958529Z","title":"arXiv preprint arXiv:2404.11999 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.02666","last_updated":"2025-08-29T15:47:44Z","snapshot_observed_at":"2026-08-18T19:51:24.628281Z","submitted_at":"2025-05-05T14:15:02Z","title":"A Survey on Progress in LLM Alignment from the Perspective of Reward Design","version":2},"reference_index":106,"source":"pdf_text","source_observed_at":"2026-08-16T00:52:06.958529Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.02666"},"observation_digest":"sha256:7a4bcd8aac11e83fd01d18ac45b349ca2140afc84060007020342e73d96322bd","observation_id":"fd73f9b8-ffdf-4584-8b9a-66948967a9b3","resolution":{"observed_at":"2026-08-16T00:52:06.958529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-15T23:58:38.862316Z","title":"Token-level direct preference optimization.arXiv preprint arXiv:2404.11999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.06273","last_updated":"2025-05-13T04:50:08Z","snapshot_observed_at":"2026-08-19T02:24:24.654154Z","submitted_at":"2025-05-06T15:09:55Z","title":"Policy-labeled Preference Learning: Is Preference Enough for RLHF?","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:58:38.862316Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.06273"},"observation_digest":"sha256:d82c260695d2f9a9222bba526facf8fc63f2c182375d46b56eacdd0e3436fd92","observation_id":"c6c3cc89-936e-48cb-92b4-9bd3348890fb","resolution":{"observed_at":"2026-08-15T23:58:38.862316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-15T20:40:51.057004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.057004Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:156c223dc28067f0d48c7dcf641d490aefbadd0ab2fb99829d1ef5d7aba1b95e","observation_id":"113a36c2-1c1d-4bd1-90a2-8ee91dc66bb3","resolution":{"observed_at":"2026-08-15T20:40:51.057004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-07T12:48:54.646894Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23540","last_updated":"2025-05-29T15:20:44Z","snapshot_observed_at":"2026-08-15T01:20:44.715694Z","submitted_at":"2025-05-29T15:20:44Z","title":"Probability-Consistent Preference Optimization for Enhanced LLM Reasoning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:48:54.646894Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.23540"},"observation_digest":"sha256:7458a4b57c3faad784d9b998a80592713dba2f2f9eb44b07cb01dfd06643dac2","observation_id":"8cc37db7-4a5c-40ce-99ae-84eaceba409b","resolution":{"observed_at":"2026-08-07T12:48:54.646894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-07T12:30:16.341645Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24445","last_updated":"2025-05-30T10:30:24Z","snapshot_observed_at":"2026-08-18T09:57:42.767716Z","submitted_at":"2025-05-30T10:30:24Z","title":"Learning Safety Constraints for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:30:16.341645Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.24445"},"observation_digest":"sha256:16b8d855adb4ccbbf2b4a90b7c294faf6be10dd26406b6bbc84f7d3b1f39fb80","observation_id":"74b81ec1-c15b-4fb3-a0bb-fb078d10d9bd","resolution":{"observed_at":"2026-08-07T12:30:16.341645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-07T11:00:54.142086Z","title":"Token-level direct preference optimization.arXiv preprint arXiv:2404.11999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06366","last_updated":"2025-06-12T10:22:01Z","snapshot_observed_at":"2026-08-09T20:26:32.963470Z","submitted_at":"2025-06-04T08:12:32Z","title":"AI Agent Behavioral Science","version":3},"reference_index":186,"source":"pdf_text","source_observed_at":"2026-08-07T11:00:54.142086Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2506.06366"},"observation_digest":"sha256:414b24662450c03fb3310db793eda717979c5625a5b9c7aa6b2a6b7af8ec123d","observation_id":"afa98307-1de3-4953-b0fe-9cce2510cb6e","resolution":{"observed_at":"2026-08-07T11:00:54.142086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2507.05179","last_updated":"2026-05-31T04:19:46Z","snapshot_observed_at":"2026-08-17T07:43:51.853231Z","submitted_at":"2025-07-07T16:34:28Z","title":"From Fragments to Facts: A Curriculum-Driven DPO Approach for Generating Hindi News Veracity Explanations","version":5},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-19T06:09:26.269452Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2507.05179"},"observation_digest":"sha256:47c953962625b5ee8b9ce3b5633404e23cf0a90d56c310cf5fa48751f44e5386","observation_id":"b868000e-f0a3-40b4-b6c6-1f723f5999fd","resolution":{"observed_at":"2026-05-19T06:12:07.126000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2508.04149","last_updated":"2026-05-16T09:55:19Z","snapshot_observed_at":"2026-08-18T01:41:11.813052Z","submitted_at":"2025-08-06T07:24:14Z","title":"Difficulty-Based Preference Data Selection by DPO Implicit Reward Gap","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-21T23:46:24.208438Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2508.04149"},"observation_digest":"sha256:99a6336ccdb2eacc44f9338869af079a349426a459624908414481c62634b56b","observation_id":"c89f84c3-6e88-4ad9-9a0f-a6ab33c4fc8e","resolution":{"observed_at":"2026-05-21T23:50:47.536613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-05T12:53:42.473198Z","title":"Token-level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01181","last_updated":"2025-09-01T07:06:36Z","snapshot_observed_at":"2026-08-16T03:36:11.332930Z","submitted_at":"2025-09-01T07:06:36Z","title":"FocusDPO: Dynamic Preference Optimization for Multi-Subject Personalized Image Generation via Adaptive Focus","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T12:53:42.473198Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2509.01181"},"observation_digest":"sha256:28e1b2d49d6ad4c694cc7402df3979fc2a39e77ea299b7367d91d4d4d62b6669","observation_id":"d8f6c5cd-fbb1-44ae-8344-3539981e24fd","resolution":{"observed_at":"2026-08-05T12:53:42.473198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-15T03:55:37.990374Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:da4980e13796b13c1e25628c99b4b0945b8fef15c5d6783a12631064d7066130","observation_id":"eb7e1abf-09c4-4a9e-9392-c24a0c7a4d6c","resolution":{"observed_at":"2026-05-21T22:24:23.532009Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-04T11:27:22.852709Z","title":"Token- level direct preference optimization.arXiv preprint arXiv:2404.11999, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.04773","last_updated":"2026-06-24T11:41:35Z","snapshot_observed_at":"2026-08-18T15:49:22.616263Z","submitted_at":"2025-10-06T12:49:00Z","title":"Distribution Preference Optimization: A Fine-grained Perspective for LLM Unlearning","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T11:27:22.852709Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2510.04773"},"observation_digest":"sha256:2aa7cccb3d1bd85732c5458408e9ea66fd8d80e023e952490c473558831d8c72","observation_id":"39310ff7-28d9-4fea-889c-7381e850af02","resolution":{"observed_at":"2026-08-04T11:27:22.852709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-16T07:11:14.391624Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":2},"reference_index":226,"source":"pdf_text","source_observed_at":"2026-05-17T00:29:07.951709Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:14a424eff04ac8c1f7f37326e3db55cc5f5d6a1fd53a45eded11a8d77b515095","observation_id":"107e3e7e-742e-4fc4-8ce9-5a2438b9cac2","resolution":{"observed_at":"2026-05-17T00:31:24.845889Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-03T18:19:31.598779Z","title":"Token-level Direct Preference Optimization,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.05929","last_updated":"2026-06-29T18:18:24Z","snapshot_observed_at":"2026-08-16T07:11:14.391624Z","submitted_at":"2025-12-05T18:12:21Z","title":"LLM Harms: A Taxonomy and Discussion","version":4},"reference_index":226,"source":"pdf_text","source_observed_at":"2026-08-03T18:19:31.598779Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2512.05929"},"observation_digest":"sha256:2311d49ada8dd34c1f0118f7370dbc63bb34acbab38ccaee486dc5c0778957f7","observation_id":"7edaff37-1b18-4831-ae58-90fd720dcab3","resolution":{"observed_at":"2026-08-03T18:19:31.598779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-08-15T02:28:31.895730Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:1749ae09e50b7fb882e9ac089059c87f518cb6bd3017ef83c41fcdac670e3a9b","observation_id":"e113064d-c96d-4e01-a4e1-845eef5436fa","resolution":{"observed_at":"2026-05-16T06:37:28.588973Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-08-15T02:28:31.895730Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:60e1a84762a827947883afcbad18cebebde3bcb58d9a10d9742262d87a263656","observation_id":"b989e5c4-d7dc-4c55-9f54-8ec5a7a0c8d1","resolution":{"observed_at":"2026-05-21T13:10:10.502504Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-16T06:39:12.822315Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-21T13:13:13.293921Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:e4a5fd36963188ef9d3d34bb497a0b710d728650dfe2006859fca4ab0d25e87a","observation_id":"1004e4b8-4187-433f-a6bd-8bc92db8614c","resolution":{"observed_at":"2026-05-21T13:14:10.968376Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-03T03:33:46.578112Z","title":"Token-level direct preference optimization.arXiv preprint arXiv:2404.11999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07832","last_updated":"2026-07-03T17:35:46Z","snapshot_observed_at":"2026-08-16T06:39:12.822315Z","submitted_at":"2026-02-08T05:47:27Z","title":"rePIRL: Learn PRM with Inverse RL for LLM Reasoning","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T03:33:46.578112Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2602.07832"},"observation_digest":"sha256:925fde99ee1061b175a13ebecc04749c96e4770d7c1ab7a5b6f65f222d820984","observation_id":"e8366876-ff4a-4a68-9242-88144359e01e","resolution":{"observed_at":"2026-08-03T03:33:46.578112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2602.23964","last_updated":"2026-04-28T09:24:17Z","snapshot_observed_at":"2026-08-16T05:00:16.829040Z","submitted_at":"2026-02-27T12:17:06Z","title":"RAD-DPO: Robust Adaptive Denoising Direct Preference Optimization for Generative Retrieval in E-commerce","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T19:05:00.826786Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2602.23964"},"observation_digest":"sha256:718508eab76711d007f2178b45ecaa9e4305a9b31ba566a4d66616273ac93d37","observation_id":"05ac2df2-b9ff-45cf-9199-d8e5fcbf58e0","resolution":{"observed_at":"2026-05-15T19:06:30.691681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2604.11259","last_updated":"2026-04-13T10:12:03Z","snapshot_observed_at":"2026-08-08T19:50:22.048210Z","submitted_at":"2026-04-13T10:12:03Z","title":"Mobile GUI Agent Privacy Personalization with Trajectory Induced Preference Optimization","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:49.149334Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2604.11259"},"observation_digest":"sha256:2bfeadaf2bd6853d23eabdf0d79c8122ee30141b7484084b49e70ad70c94c144","observation_id":"658ce455-d299-478c-9890-70c9f127eba5","resolution":{"observed_at":"2026-05-11T09:11:01.145338Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2604.14379","last_updated":"2026-04-15T19:52:05Z","snapshot_observed_at":"2026-08-11T07:35:08.207298Z","submitted_at":"2026-04-15T19:52:05Z","title":"Step-level Denoising-time Diffusion Alignment with Multiple Objectives","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-10T13:15:13.005136Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2604.14379"},"observation_digest":"sha256:105530fd0b04104d44bfd38aca40ae2e1ecfb87928b25d7b896eeacc397db1d5","observation_id":"3fd45605-c623-4937-a472-9f913ea078d2","resolution":{"observed_at":"2026-05-10T13:15:25.868966Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-12T18:27:15.382806Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-09T19:26:57.596581Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:701a810016fd714460756ce7a64177145a517ec22c4b838ebc028ad6b3875aca","observation_id":"1325efea-62bc-48c4-8707-c6fde731cd83","resolution":{"observed_at":"2026-05-11T15:41:44.376403Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2605.00380","last_updated":"2026-05-08T11:24:05Z","snapshot_observed_at":"2026-08-12T18:27:15.382806Z","submitted_at":"2026-05-01T03:57:44Z","title":"ResRL: Boosting LLM Reasoning via Negative Sample Projection Residual Reinforcement Learning","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-11T02:07:21.806345Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2605.00380"},"observation_digest":"sha256:1e330f347d40a6afbccd70f082af2dd913d583d414d151d56390e0b030602715","observation_id":"f0ca4aaf-90d5-4706-bdf6-b147accde66f","resolution":{"observed_at":"2026-05-11T03:55:56.600639Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":192,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:257b66caedb416bedeeee346ffda5599a52418687c7fd3b6507216d3742a9aee","observation_id":"57c9d52e-3b80-44bf-9d55-2c43f27631dc","resolution":{"observed_at":"2026-05-13T04:57:17.310837Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T22:15:53.639048Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:06be173378caa503db7ed98e315ad4cd303e53cb9d3abbf4938f3296e260dc9c","observation_id":"94827eba-847a-4d7b-9b89-3502ab126c78","resolution":{"observed_at":"2026-07-01T14:05:47.253592Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2606.08035","last_updated":"2026-06-06T07:56:25Z","snapshot_observed_at":"2026-08-19T01:23:57.151803Z","submitted_at":"2026-06-06T07:56:25Z","title":"DyCo-RL: Dynamic Cross-Modal Coordination for Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T20:08:29.208550Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2606.08035"},"observation_digest":"sha256:550098c7da6a03e7ed311f36b13f38a340f0db2953818731abad94f478082d14","observation_id":"a8e2813e-a815-4476-8a2a-e98ae7d2016c","resolution":{"observed_at":"2026-07-02T20:47:23.097979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2606.12590","last_updated":"2026-06-10T18:35:36Z","snapshot_observed_at":"2026-08-06T17:35:29.796295Z","submitted_at":"2026-06-10T18:35:36Z","title":"Analyzing and Improving Fine-grained Preference Optimization in Medical LVLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-27T09:52:20.508013Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2606.12590"},"observation_digest":"sha256:4d8f163cf9b6916dfd8e06b99c204a163382f4ed1ea61cb2c8e6f88ed4b8742d","observation_id":"a5ba103b-130b-4b35-b5e4-2252069b86d8","resolution":{"observed_at":"2026-07-03T10:48:02.076164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":"2404.11999","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-07-03T10:48:02.074671Z","title":"Lianmin Zheng, Wei-Lin Chiang, Ying Sheng, Siyuan Zhuang, Zhanghao Wu, Yonghao Zhuang, Zi Lin, Zhuohan Li, Dacheng Li, Eric P","venue":null,"work_id":"af0486c0-066d-4abb-b97b-99ce01accf11","year":2024},"citing_paper":{"arxiv_id":"2606.29150","last_updated":"2026-06-28T02:10:36Z","snapshot_observed_at":"2026-08-14T07:39:55.571318Z","submitted_at":"2026-06-28T02:10:36Z","title":"Flow Reasoning Models: Scaling Reasoning Through Iterative Self-Refinement","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T07:55:28.254309Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2606.29150"},"observation_digest":"sha256:f785a779441f863b5774c2f5fe456cfbc09c5bd93ae261a71187fbd89c1767ef","observation_id":"ac02c51d-db5c-49a4-8a67-44dc879a8e09","resolution":{"observed_at":"2026-06-30T08:04:28.458045Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-01T17:47:42.921201Z","title":"Token-level direct preference optimization.arXiv preprint arXiv:2404.11999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-20T10:47:57.766843Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.921201Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:37e4edff87193c7073452f8bcea610c23335805622ec2dfcb196c5b91aacd56a","observation_id":"e631884d-355e-47d0-9e7c-6c823cd3d4cd","resolution":{"observed_at":"2026-08-01T17:47:42.921201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-01T07:28:36.606953Z","title":"arXiv preprint arXiv:2404.11999 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21453","last_updated":"2026-07-24T02:14:44Z","snapshot_observed_at":"2026-08-19T15:31:20.809514Z","submitted_at":"2026-07-23T15:55:29Z","title":"Test-Time Scaling via Error Localization","version":2},"reference_index":182,"source":"arxiv_source","source_observed_at":"2026-08-01T07:28:36.606953Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2607.21453"},"observation_digest":"sha256:629246ce21f6f985ca02303397e841c80ec8e7c911a15d2e1a8f9651315b8f8a","observation_id":"6cb38f9a-977e-4430-8c10-a4f24d11d9dc","resolution":{"observed_at":"2026-08-01T07:28:36.606953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-16T00:23:45.924802Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.12049","last_updated":"2026-08-12T13:28:56Z","snapshot_observed_at":"2026-08-19T07:56:12.502820Z","submitted_at":"2026-08-12T13:28:56Z","title":"Token-Level Credit Assignment Optimization for Generative Document Retrieval","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T00:23:45.924802Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2608.12049"},"observation_digest":"sha256:8493da15eededf4dd4713bed03da5c54563a7910056d20ddad14d856fb2efc2a","observation_id":"54293756-9f1b-415b-aaa1-5be4700cd828","resolution":{"observed_at":"2026-08-16T00:23:45.924802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2404.11999/citation-record","integrity":"/paper/2404.11999/integrity","json":"/paper/2404.11999/citation-record.json","paper":"/paper/2404.11999"},"outbound":[],"paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 39 inbound Pith citation observations for arXiv:2404.11999."}