{"as_of":"2026-08-07T16:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab32c8c4578db8dadbfedc14cb7fedd0e31584785da0fa30c26c7d3f0b9403f9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":12,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:35:14.904703Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T22:24:23.529928Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T21:20:59.128986Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2501.09686"},"observation_digest":"sha256:5350cfc0fd587530bbc714dba4aa6d31e7d43db010a6c4e78589567d3259b2ba","observation_id":"b2d22c02-1478-414f-8744-afb40f444c3a","resolution":{"observed_at":"2026-05-15T21:20:59.493391Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-07T12:35:14.904703Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24251","last_updated":"2025-05-30T06:16:30Z","snapshot_observed_at":"2026-08-07T12:25:27.475749Z","submitted_at":"2025-05-30T06:16:30Z","title":"Proactive Guidance of Multi-Turn Conversation in Industrial Search","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:35:14.904703Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2505.24251"},"observation_digest":"sha256:eaf18c9627235e6a2965534a9cf0c37fbda035c8f222c8a94257400e3fc0059f","observation_id":"85257a83-460a-4538-aef6-ff869f385e16","resolution":{"observed_at":"2026-08-07T12:35:14.904703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-07T11:00:53.302553Z","title":"Direct preference optimization with an offset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06366","last_updated":"2025-06-12T10:22:01Z","snapshot_observed_at":"2026-08-07T10:55:12.794223Z","submitted_at":"2025-06-04T08:12:32Z","title":"AI Agent Behavioral Science","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:00:53.302553Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2506.06366"},"observation_digest":"sha256:14c08fd5cdd3d83d23215106d1b96f2c2c2146ff2288dfed3b0fccaee81dea8d","observation_id":"e669799f-6b5e-4c36-a8fd-f7011e9720ec","resolution":{"observed_at":"2026-08-07T11:00:53.302553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-07T05:40:17.819727Z","title":"Direct preference optimization with an offset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07492","last_updated":"2025-06-09T07:11:01Z","snapshot_observed_at":"2026-08-07T05:29:54.015791Z","submitted_at":"2025-06-09T07:11:01Z","title":"Explicit Preference Optimization: No Need for an Implicit Reward Model","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:40:17.819727Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2506.07492"},"observation_digest":"sha256:fa4050c038c016730e3eaed9f66654d025c4a883ed204425b15c2cf560d086dc","observation_id":"587bad29-1ff8-4a50-9e75-684abf84c47f","resolution":{"observed_at":"2026-08-07T05:40:17.819727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-05T15:19:28.641196Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.20038","last_updated":"2025-09-04T09:23:46Z","snapshot_observed_at":"2026-08-07T05:30:23.213101Z","submitted_at":"2025-08-27T16:44:03Z","title":"Forewarned is Forearmed: Pre-Synthesizing Jailbreak-like Instructions to Enhance LLM Safety Guardrail to Potential Attacks","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T15:19:28.641196Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2508.20038"},"observation_digest":"sha256:ed62c59093a1a211d57e2bd4179208f3cc29d5b1a420991eacee64ee35bdfde6","observation_id":"7e6f84a1-65fd-4f01-a787-58d2bebc5535","resolution":{"observed_at":"2026-08-05T15:19:28.641196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2509.03526","last_updated":"2026-05-20T03:07:46Z","snapshot_observed_at":"2026-08-07T01:53:38.136292Z","submitted_at":"2025-08-25T07:31:48Z","title":"Enhancing Speech Large Language Models through Reinforced Behavior Alignment","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-21T22:23:52.392075Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2509.03526"},"observation_digest":"sha256:563f65d2163c68c0c10801cee6e864b90c9e402dce239ca60ce2bfcc0dc2043b","observation_id":"8200f43e-7039-4015-b85e-48e6225b2dfc","resolution":{"observed_at":"2026-05-21T22:24:23.531850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-04T14:52:18.602366Z","title":"Amini, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-06T14:54:39.466904Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.602366Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:30f5a0df3c1ea2b462528286dfb8e38f00c88d88518ba69b661557e58aed8441","observation_id":"d26ae2f7-df07-4591-ab61-cb299ee78d85","resolution":{"observed_at":"2026-08-04T14:52:18.602366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2605.02200","last_updated":"2026-05-04T03:58:53Z","snapshot_observed_at":"2026-07-06T23:15:18.048504Z","submitted_at":"2026-05-04T03:58:53Z","title":"ARGUS: Policy-Adaptive Ad Governance via Evolving Reinforcement with Adversarial Umpiring","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-08T19:36:05.119054Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2605.02200"},"observation_digest":"sha256:f72704a3885a5718dc1c177d7a5e32d2bfc8ce96c24cc1970bf705bdeee794a5","observation_id":"0b0e7a2d-45c4-4445-95f1-a1676ebdece4","resolution":{"observed_at":"2026-05-09T05:45:21.958494Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2605.08472","last_updated":"2026-05-08T20:46:35Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T20:46:35Z","title":"Mid-Training with Self-Generated Data Improves Reinforcement Learning in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-12T01:11:50.343466Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2605.08472"},"observation_digest":"sha256:0000fe434dc25c0ada75129ce07e0d415710bab0032e9218cffaba1a534977d6","observation_id":"ff72c57d-92f4-4a47-8303-02b273dab3f7","resolution":{"observed_at":"2026-05-12T08:26:23.350262Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2605.10784","last_updated":"2026-05-11T16:18:08Z","snapshot_observed_at":"2026-07-06T23:22:42.512039Z","submitted_at":"2026-05-11T16:18:08Z","title":"MASS-DPO: Multi-negative Active Sample Selection for Direct Policy Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-12T04:14:37.374346Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2605.10784"},"observation_digest":"sha256:e3642daa7acad678c1aa966eaae51c262f9e4906c35db9bb53bc64bcd3999af9","observation_id":"11a4a659-dace-45ea-a427-ed31b495a799","resolution":{"observed_at":"2026-05-12T06:31:24.730093Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":"2402.10571","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Direct preference optimization with an offset","venue":null,"work_id":"aca16f09-1a50-46c9-ba22-07ebf249d309","year":2024},"citing_paper":{"arxiv_id":"2605.11974","last_updated":"2026-05-12T11:31:18Z","snapshot_observed_at":"2026-07-06T23:23:44.276236Z","submitted_at":"2026-05-12T11:31:18Z","title":"Towards Order Fairness: Mitigating LLMs Order Sensitivity through Dual Group Advantage Optimization","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-13T07:32:58.404947Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2605.11974"},"observation_digest":"sha256:fe08109b494e667279681149db9eb72cdf9b7919149f2d7a59e41ca312a45317","observation_id":"104d1f22-4915-4274-ac35-a8d19d9c7e2b","resolution":{"observed_at":"2026-05-13T07:37:29.874766Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-01T10:59:13.062985Z","title":"Direct preference optimization with an offset","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20057","last_updated":"2026-07-22T11:59:38Z","snapshot_observed_at":"2026-08-05T01:59:04.033220Z","submitted_at":"2026-07-22T11:59:38Z","title":"Antigen-specific Antibody Multi-modal Foundation Model for Functional Antibody Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T10:59:13.062985Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2607.20057"},"observation_digest":"sha256:d8a040f3d64067e1efc90f711e368b2e89fce7e3a9f895ab98bcabfc314c244a","observation_id":"979f0979-22a4-4414-8841-c8a0c59959df","resolution":{"observed_at":"2026-08-01T10:59:13.062985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2402.10571/citation-record","integrity":"/paper/2402.10571/integrity","json":"/paper/2402.10571/citation-record.json","paper":"/paper/2402.10571"},"outbound":[],"paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 12 inbound Pith citation observations for arXiv:2402.10571."}