{"as_of":"2026-08-17T05:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3e17ade86412020389a7c0896d6c3d42e43af35d85d856cb60d2bc574f94c2bd","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T17:47:43.553604Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.17524/citation-record","integrity":"/paper/2607.17524/integrity","json":"/paper/2607.17524/citation-record.json","paper":"/paper/2607.17524"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:41.154463Z","title":"Survey of hallucination in natural language generation.ACM computing surveys, 55(12):1–38,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.154463Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:0212cc948bd10677240721d24b50bd2fd93be68b282914e9c1bdab8cc197883b","observation_id":"3da58420-39b0-4edd-92a6-4a4ddfb8bae4","resolution":{"observed_at":"2026-08-01T17:47:41.154463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20783","last_updated":"2025-10-06T09:30:03Z","snapshot_observed_at":"2026-08-13T12:34:54.476684Z","submitted_at":"2025-03-26T17:59:14Z","title":"Understanding R1-Zero-Like Training: A Critical Perspective","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20783","snapshot_observed_at":"2026-08-01T17:47:41.428723Z","title":"Understanding r1-zero-like training: A critical perspective.arXiv preprint arXiv:2503.20783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.428723Z"},"links":{"cited_paper":"/paper/2503.20783","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:9b43a4be8a79c7bbf18a2957b38c3fffd9c266c96d4491185431eef1b39533ca","observation_id":"41b6b21c-0365-4d8c-ac50-c5c6385ed9a1","resolution":{"observed_at":"2026-08-01T17:47:41.428723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20847","last_updated":"2025-02-28T08:47:03Z","snapshot_observed_at":"2026-08-16T12:54:21.533906Z","submitted_at":"2025-02-28T08:47:03Z","title":"Gradient Imbalance in Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20847","snapshot_observed_at":"2026-08-01T17:47:41.496853Z","title":"Gradient imbalance in direct preference optimization.arXiv preprint arXiv:2502.20847,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.496853Z"},"links":{"cited_paper":"/paper/2502.20847","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:549240611ee5e929d86f71ab1e71dca37be36012bc473c1cbdf2ebb9f244b699","observation_id":"4b061c23-3988-42e5-b43c-950eb3aa9a92","resolution":{"observed_at":"2026-08-01T17:47:41.496853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06824","last_updated":"2024-08-19T01:18:41Z","snapshot_observed_at":"2026-07-06T16:30:37.867641Z","submitted_at":"2023-10-10T17:54:39Z","title":"The Geometry of Truth: Emergent Linear Structure in Large Language Model Representations of True/False Datasets","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06824","snapshot_observed_at":"2026-08-01T17:47:41.542364Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets.arXiv preprint arXiv:2310.06824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.542364Z"},"links":{"cited_paper":"/paper/2310.06824","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:a07bff55fafa0b17c52534ff0927863f86dd3b07b5176ee93c5be410bff40c8f","observation_id":"842db8ad-6ec5-4f84-9d4f-5cc4f302b195","resolution":{"observed_at":"2026-08-01T17:47:41.542364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06855","last_updated":"2024-08-12T21:40:04Z","snapshot_observed_at":"2026-08-16T14:27:50.949196Z","submitted_at":"2024-01-12T19:02:48Z","title":"Fine-grained Hallucination Detection and Editing for Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06855","snapshot_observed_at":"2026-08-01T17:47:41.610917Z","title":"Fine-grained hallucination detection and editing for language models.arXiv preprint arXiv:2401.06855,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.610917Z"},"links":{"cited_paper":"/paper/2401.06855","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:f64b7fc6b92360ce7286f712435a5d7c9714c81a98aced851c09b499ad51a86b","observation_id":"fbed606d-0c35-4571-98fd-1eacac1be6c2","resolution":{"observed_at":"2026-08-01T17:47:41.610917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:41.699281Z","title":"doi: 10.1038/s41586-024-07335-x","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.699281Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:37f4ac2e0ff43963c951af6734033d8633f66e24b475930eb495d071e0d29d2a","observation_id":"a0a87f47-dcf7-46dc-bbc3-a732970e3f33","resolution":{"observed_at":"2026-08-01T17:47:41.699281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-01T17:47:41.779404Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.779404Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:1233e971f44787874d2b05d0b03a0e991f90038c1f1648ce42fd2e9e14e2174b","observation_id":"a5817823-ff2c-4609-bd54-c90960077c26","resolution":{"observed_at":"2026-08-01T17:47:41.779404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T17:47:41.914703Z","title":"Deepseekmath: Pushing the limits of mathe- matical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.914703Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:93070f9f593ab9e147842586184db2c0c391efdd067181b240c4458e79381046","observation_id":"688fed70-b9ff-4980-ad11-b4cc96599377","resolution":{"observed_at":"2026-08-01T17:47:41.914703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:41.994642Z","title":"Understanding factual errors in summarization: Errors, summarizers, datasets, error detectors","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.994642Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:875dc62a3e19630e27601a0fe243b5b9529a0c786eb22291848a6c403c61ecf6","observation_id":"eaf141bd-b34e-4573-b83a-c96012071de3","resolution":{"observed_at":"2026-08-01T17:47:41.994642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:42.112835Z","title":"Minicheck: Efficient fact-checking of llms on grounding documents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.112835Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:a54dc75c5cdd24b1d8a0c2c7477cfeb0db31ac685114fbc57071e239842c7457","observation_id":"6114e41b-8180-477a-9910-8ae39f55d535","resolution":{"observed_at":"2026-08-01T17:47:42.112835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-01T17:47:42.254879Z","title":"Alexander Matt Turner, Lisa Thiergart, Gavin Leech, David Udell, Juan J Vazquez, Ulisse Mini, and Monte MacDiarmid","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.254879Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:e68811741ade3c7551fafad7238cd61051de224496f57e5038a7d63ef18b638f","observation_id":"86d193b3-c1ce-40bf-bf0e-65c57c5fc782","resolution":{"observed_at":"2026-08-01T17:47:42.254879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.00676","last_updated":"2025-08-31T03:08:02Z","snapshot_observed_at":"2026-08-14T04:31:24.300394Z","submitted_at":"2025-08-31T03:08:02Z","title":"LLaVA-Critic-R1: Your Critic Model is Secretly a Strong Policy Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.00676","snapshot_observed_at":"2026-08-01T17:47:42.427244Z","title":"Llava-critic-r1: Your critic model is secretly a strong policy model.arXiv preprint arXiv:2509.00676,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.427244Z"},"links":{"cited_paper":"/paper/2509.00676","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:c1e5d3837f7bd2f171380524977c4dd28d78c1bba37ec8dfe2eb4df15d7be1d4","observation_id":"c5a3c139-f196-4cae-aa08-cd8e0f2cc00a","resolution":{"observed_at":"2026-08-01T17:47:42.427244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04319","last_updated":"2019-09-26T23:57:44Z","snapshot_observed_at":"2026-08-16T12:52:32.574265Z","submitted_at":"2019-08-12T18:09:04Z","title":"Neural Text Generation with Unlikelihood Training","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04319","snapshot_observed_at":"2026-08-01T17:47:42.511417Z","title":"Neural text generation with unlikelihood training.arXiv preprint arXiv:1908.04319,","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.511417Z"},"links":{"cited_paper":"/paper/1908.04319","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:94a1e8a467195d99338a9464a9eebe5b2bc55969f13601e97ac12d8e7598aa73","observation_id":"77cfbb00-f862-4196-adfc-dc88b6390736","resolution":{"observed_at":"2026-08-01T17:47:42.511417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T17:47:42.664555Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.664555Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:0ad4949ecf3b9747804219a63c1a0bf29ee2386ad80fca19f1b55d5a1b9757ff","observation_id":"3fe38bd6-a41b-4e3d-a2aa-0fcbddf74436","resolution":{"observed_at":"2026-08-01T17:47:42.664555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14476","last_updated":"2025-05-20T01:37:34Z","snapshot_observed_at":"2026-08-02T01:40:54.187278Z","submitted_at":"2025-03-18T17:49:06Z","title":"DAPO: An Open-Source LLM Reinforcement Learning System at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14476","snapshot_observed_at":"2026-08-01T17:47:42.786853Z","title":"Dapo: An open-source llm reinforcement learning system at scale.arXiv preprint arXiv:2503.14476,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.786853Z"},"links":{"cited_paper":"/paper/2503.14476","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:16756bb54c7d9a06a75cd668654232df99fa41cc873e648c8155b3310ff08b83","observation_id":"c8419bea-dd29-4331-bf42-39254e5f7aab","resolution":{"observed_at":"2026-08-01T17:47:42.786853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-16T17:34:11.389619Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-01T17:47:42.921201Z","title":"Token-level direct preference optimization.arXiv preprint arXiv:2404.11999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.921201Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:580245009223e1d81578f101c96cd32fce8f2b3eaf1d6c1a95958c6998242e80","observation_id":"e631884d-355e-47d0-9e7c-6c823cd3d4cd","resolution":{"observed_at":"2026-08-01T17:47:42.921201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-01T17:47:43.057405Z","title":"Fine-tuning language models from human prefer- ences.arXiv preprint arXiv:1909.08593,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:43.057405Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:31bf154a93e982d9940b50680c88d2ddf00069505fc4219ba5a49e1c91d6d606","observation_id":"8069122d-7f13-4587-98ed-d1b5b9ffabb8","resolution":{"observed_at":"2026-08-01T17:47:43.057405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:43.165843Z","title":"Specifically, instead of decomposing the summary into individual sentences, we directly evaluate the full summary using the Bespoke-MiniCheck-7B model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:43.165843Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:5cb79cb1871814ff9660f2ab243731308fe74455b9b96d5b7030ff99354a7821","observation_id":"909a909d-ff3e-4154-b870-0c392f81cb28","resolution":{"observed_at":"2026-08-01T17:47:43.165843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:43.343218Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:43.343218Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:b1d60934913b1f98ffc37dbea549c07cd04163a310f037ef5386159bfb81d6ef","observation_id":"46016e8d-6493-46e3-9c48-a24819a1be9c","resolution":{"observed_at":"2026-08-01T17:47:43.343218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:43.553604Z","title":"We report the total number of supervised tokens and the proportion of positive (factual) and negative (hallucinated) labels for each configuration","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:43.553604Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:99b33a43eff4d53341240d9e134ab832aa16c9ccca3183e241797cfe9bca0996","observation_id":"6fd21c68-a7c1-4fba-89f4-aeb74e2991da","resolution":{"observed_at":"2026-08-01T17:47:43.553604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10947","last_updated":"2026-02-25T01:06:05Z","snapshot_observed_at":"2026-08-14T00:59:03.111530Z","submitted_at":"2025-06-12T17:49:55Z","title":"Spurious Rewards: Rethinking Training Signals in RLVR","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10947","snapshot_observed_at":"2026-08-01T17:47:41.835722Z","title":"Spurious rewards: Rethinking training signals in rlvr.arXiv preprint arXiv:2506.10947,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.835722Z"},"links":{"cited_paper":"/paper/2506.10947","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:95e65cc01a5abf86caccd306aa1749a7fba2e8b82f12b6111615c87b24074896","observation_id":"3348cd36-1e17-4155-90d2-f7211246e2ce","resolution":{"observed_at":"2026-08-01T17:47:41.835722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10719","last_updated":"2024-10-10T08:30:17Z","snapshot_observed_at":"2026-08-16T14:00:26.360262Z","submitted_at":"2024-04-16T16:51:53Z","title":"Is DPO Superior to PPO for LLM Alignment? A Comprehensive Study","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10719","snapshot_observed_at":"2026-08-01T17:47:42.557783Z","title":"Is dpo superior to ppo for llm alignment? a comprehensive study.arXiv preprint arXiv:2404.10719,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:42.557783Z"},"links":{"cited_paper":"/paper/2404.10719","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:4b4f804d870eb4f4502bb77a1d68a130fab0009d30211b8a7ba95fc4e6cac055","observation_id":"2ad160cc-c056-47c0-8fff-665c7d7790fe","resolution":{"observed_at":"2026-08-01T17:47:42.557783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:40.966435Z","title":"Tldr: Token-level detective reward model for large vision language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:40.966435Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:06c0abf9860fe9cb615044bf2e826ec7089277fb1b94351806ea189a9eb95ebe","observation_id":"e0425af6-4c99-431e-b646-bc9bfe2fc42a","resolution":{"observed_at":"2026-08-01T17:47:40.966435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:41.295760Z","title":"Programming refusal with conditional ac- tivation steering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.295760Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:4a64ce68c0d038bde3bf7f9e91fda18b233c52f6953f6a62edf1b13eac13a223","observation_id":"00bd0b4c-a756-45f3-9a03-77bb77936994","resolution":{"observed_at":"2026-08-01T17:47:41.295760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:40.898240Z","title":"doi: 10.18653/v1/2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:40.898240Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:a7bf536edec25cdfd4261c0bb58fa109c26bc71a385002336dda8ab9df0e442a","observation_id":"93b194f0-782d-486a-90bb-8781124eb519","resolution":{"observed_at":"2026-08-01T17:47:40.898240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T17:47:41.056047Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:41.056047Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:6aff79820e11394dc91747f9b73ffaa5796db48a9ffb5ffe0a6ac636126c7e50","observation_id":"841e4ae7-d903-4de7-98ee-5e41a1510015","resolution":{"observed_at":"2026-08-01T17:47:41.056047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T17:47:40.833651Z","title":"Findings of the WMT 2024 shared task of the open language data initiative","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T17:47:40.833651Z"},"links":{"citing_paper":"/paper/2607.17524"},"observation_digest":"sha256:af14867ab6a5075f37ee132408d53b09795bddcf38dab4bb65a747150d3a04bb","observation_id":"7ee16ce7-4528-45de-8914-fca83a289185","resolution":{"observed_at":"2026-08-01T17:47:40.833651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.17524","last_updated":"2026-07-20T03:57:22Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T22:08:45.360024Z","submitted_at":"2026-07-20T03:57:22Z","title":"Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2607.17524."}