{"as_of":"2026-08-19T07:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e30825f141b3c6af137afd70e9716706fbc73bea52e97eb15041765c0b92b5e2","coverage":[{"denominator":66,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":66,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:40:51.092593Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12435/citation-record","integrity":"/paper/2505.12435/integrity","json":"/paper/2505.12435/citation-record.json","paper":"/paper/2505.12435"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.787555Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.787555Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:1f302a9a765461502a3fed3adffeafcac633749a4f4f2dfba6c36bec5de3a838","observation_id":"3daead4f-b2b8-4a69-986a-f40a5f44846a","resolution":{"observed_at":"2026-08-15T20:40:50.787555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.792034Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.792034Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2956517ea3005967d525209cf8bb4f43ac9622a9617803db940041052f518e69","observation_id":"471db8dc-dc7a-4efc-ae10-251227468576","resolution":{"observed_at":"2026-08-15T20:40:50.792034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.798147Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.798147Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:cd02f25e5615175037e11b35b2ebc8d440060e4e5e1b4cb1d3bac10f7cf45b18","observation_id":"242e1644-c186-499d-8257-06c3c33462bc","resolution":{"observed_at":"2026-08-15T20:40:50.798147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.802374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.802374Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:36ce1d30fca04bbf5ee2cc110fda97d8f3b6c5a00856b64109f93b9f944302ef","observation_id":"eb030c38-f58d-4ec7-acc3-9d46281e1ff9","resolution":{"observed_at":"2026-08-15T20:40:50.802374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-18T18:51:43.695932Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-15T20:40:50.806492Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.806492Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0250ee4b94c33dc72f0ff119b1f3c569317207b9aaf264ddae4cce094c4f9392","observation_id":"15c011cf-db3a-4cb5-be37-336a26bf220c","resolution":{"observed_at":"2026-08-15T20:40:50.806492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T20:40:50.810310Z","title":"Brown, Jack Clark, Sam McCandlish, Chris Olah, Benjamin Mann, and Jared Kaplan","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.810310Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0890114ae34de1a1dca7683ffe28a836b33e536ad1cc071e9185af7cc4fb8237","observation_id":"4f1163fb-4054-4734-b9d2-c770d6a7843f","resolution":{"observed_at":"2026-08-15T20:40:50.810310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-14T19:47:04.330126Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-15T20:40:50.814418Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.814418Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:84898697570dd12703f4bf8112a603d9326be69b2e09b329b3d350bc1063fe7a","observation_id":"cb26f0d1-c64b-4224-a5c6-a1293c47d654","resolution":{"observed_at":"2026-08-15T20:40:50.814418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.198342Z","title":null,"venue":null,"work_id":"f83b63af-0ba1-4f62-aff7-bd428c330e5e","year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.818145Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a84431add7058e1d1908438c6f86da114d92bb8d98bb543bf67f547e93631bf3","observation_id":"50cb692c-a232-41fa-ab4e-baea64a1708d","resolution":{"observed_at":"2026-08-15T20:40:52.202520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.181884Z","title":null,"venue":null,"work_id":"7cba1f9e-3ae2-4a59-91c6-126e2c7231d5","year":1952},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.821666Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:932808669beafa744fd561bea94b4cb5a6032cfb48f16a6cecbf1e5e92a058ff","observation_id":"e7c1db1a-76ad-4499-b186-915f89c90781","resolution":{"observed_at":"2026-08-15T20:40:52.188957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.163180Z","title":null,"venue":null,"work_id":"e78bb39a-75b6-49ef-9f46-646b31a44212","year":1952},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.825083Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:92805b99a3f9e511452a178b04a4ad3b55169d45e19ed1c66d0f3b29c4b82033","observation_id":"6dcde4ba-4f9d-4f36-bff6-14f2ee10ce64","resolution":{"observed_at":"2026-08-15T20:40:52.169980Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.149131Z","title":"Sheng, Huaiyu Dai, and Dejing Dou","venue":null,"work_id":"dd706ec0-cbb2-4ab7-a25f-144bdb59aa18","year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.828658Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:88613e50a70d6f291f59487f671f8aab6263abf9da4fea487b045984599e9da6","observation_id":"8c1eb1aa-7c0f-4795-9129-1c93642ab4f3","resolution":{"observed_at":"2026-08-15T20:40:52.154030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.136306Z","title":null,"venue":null,"work_id":"64d0de99-3871-4df8-aa75-204fcdd7d22b","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.832240Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:3785c779689b2f8fe1a77ff52471fcb8556a310b76dcbebc644065eee372c944","observation_id":"5bce26c4-f3eb-4eab-9a1f-d769ef985db7","resolution":{"observed_at":"2026-08-15T20:40:52.140887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05369","last_updated":"2024-10-30T07:29:40Z","snapshot_observed_at":"2026-08-16T14:20:22.893368Z","submitted_at":"2024-02-08T02:58:47Z","title":"Noise Contrastive Alignment of Language Models with Explicit Rewards","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05369","snapshot_observed_at":"2026-08-15T20:40:50.836712Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.836712Z"},"links":{"cited_paper":"/paper/2402.05369","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:14c294b2bb9a2da734556114bab2e7dd9782c5b26f29b6733d04afca07962d2f","observation_id":"116b5ec6-b7b1-4a06-a2f3-92de6de188de","resolution":{"observed_at":"2026-08-15T20:40:50.836712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-08-14T19:36:07.505691Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-15T20:40:50.840423Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.840423Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:1502c87596dd5dacbb35535b9f97c25024aa9d3dc415c97f90ca66d3212ca07a","observation_id":"94b237cb-c520-4d8e-ac12-01df6f1c74ad","resolution":{"observed_at":"2026-08-15T20:40:50.840423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-15T20:40:50.844143Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.844143Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:df25afe4e2491fb4810ffb1b2a5a762dff53ab67790983c7f99d3abd1cf22646","observation_id":"a6d4f618-b656-4312-beb0-5df380dd9ed3","resolution":{"observed_at":"2026-08-15T20:40:50.844143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-15T20:40:50.847988Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.847988Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:c2596e7f8fff0ce4bcf238712691a071872524f8a57c7fd0ce39af5dd62382c6","observation_id":"59f474a5-f2d2-46a8-afa8-4ca17752d813","resolution":{"observed_at":"2026-08-15T20:40:50.847988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-15T20:40:50.852840Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.852840Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2ceac99359b088869b28ed184fb93ff80414c3671efd99b467678c0866851f3a","observation_id":"f473829f-c119-4b41-816d-8ea4ab4ef353","resolution":{"observed_at":"2026-08-15T20:40:50.852840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-15T20:40:50.856604Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.856604Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:083a3e17132511d0dba90f4d0e0df5fbf4bbad7c572193ccc37ababe4de49cab","observation_id":"2c946d99-1fd2-4baa-a825-94d7a8028475","resolution":{"observed_at":"2026-08-15T20:40:50.856604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-15T20:40:50.861519Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.861519Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:7f1166768552a9896724d89a3020d01f578ed551bfdab93c9577f52cf86ee04d","observation_id":"ecb7e8e0-9952-40de-985d-ba8bbeacb3b9","resolution":{"observed_at":"2026-08-15T20:40:50.861519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14387","last_updated":"2024-01-08T04:46:56Z","snapshot_observed_at":"2026-08-16T17:34:14.000776Z","submitted_at":"2023-05-22T17:55:50Z","title":"AlpacaFarm: A Simulation Framework for Methods that Learn from Human Feedback","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14387","snapshot_observed_at":"2026-08-15T20:40:50.867012Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.867012Z"},"links":{"cited_paper":"/paper/2305.14387","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:ed1b6a7e3d54d39b5dcd664af247d3e5522418055fc9787660e17f8fae39f21b","observation_id":"def4e0e7-5314-4c03-98aa-0e9226a715c1","resolution":{"observed_at":"2026-08-15T20:40:50.867012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.117852Z","title":null,"venue":null,"work_id":"28c87698-8dc3-43dc-8753-0325114a1e4c","year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.873915Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:3f8e2c261d643f0ac0db168db12ad5a7266dfbfd237ab86d84ac02116ea23677","observation_id":"63efa318-3e9b-4326-8878-ef7c58462398","resolution":{"observed_at":"2026-08-15T20:40:52.126768Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-08-17T15:29:47.883677Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01306","snapshot_observed_at":"2026-08-15T20:40:50.878800Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.878800Z"},"links":{"cited_paper":"/paper/2402.01306","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0391a04464d5d25c91d3d7f67e75cbfea4a2b3bec5efefcf63516c6bb6b10f6c","observation_id":"dc60c685-346b-4bfd-84ad-f9d20e27992f","resolution":{"observed_at":"2026-08-15T20:40:50.878800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04626","last_updated":"2024-04-06T13:24:37Z","snapshot_observed_at":"2026-08-16T14:03:07.999935Z","submitted_at":"2024-04-06T13:24:37Z","title":"Towards Analyzing and Understanding the Limitations of DPO: A Theoretical Perspective","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04626","snapshot_observed_at":"2026-08-15T20:40:50.883420Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.883420Z"},"links":{"cited_paper":"/paper/2404.04626","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e97a60483aeb71482d4c8083a7fd54fb80f98b8d193777f0238cf4f6930f1d9c","observation_id":"7a277e6e-d56e-45de-8967-eb401de4836a","resolution":{"observed_at":"2026-08-15T20:40:50.883420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.103040Z","title":null,"venue":null,"work_id":"6ac2e24b-dfb2-4b6b-8448-a17a9130d107","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.888201Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:165d2ceb6a9788dfb5536d260a3f0898e27a6664d67fcd78bb8ff3ad2419e5db","observation_id":"33fdbbea-461d-46bb-a380-38e669142bb2","resolution":{"observed_at":"2026-08-15T20:40:52.107987Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.086798Z","title":null,"venue":null,"work_id":"fefa0426-18ee-4101-af91-a039b16b5e63","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.892378Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:c70d7b6774627a6523f2940661040f58ed87a1ee6fe6092b33af9e56b64351da","observation_id":"f4dfa443-3d81-45fb-9ef8-cdc03312dd05","resolution":{"observed_at":"2026-08-15T20:40:52.092389Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-15T20:40:50.898674Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.898674Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:04378f823adc583cce0833b7fc35180e1180223be2974bb383d7a54723bff827","observation_id":"63839f5a-2dcf-4b47-84ee-314c01a29507","resolution":{"observed_at":"2026-08-15T20:40:50.898674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.057557Z","title":null,"venue":null,"work_id":"8aa2dcc0-5d28-495e-9aa0-8b4a574f0b69","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.903456Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:75616395223e8af3fec021e528e42915a7e51a06cf26054fe64aad0d49121a79","observation_id":"bbb0a843-c63b-4c3f-872b-a31894efb4ca","resolution":{"observed_at":"2026-08-15T20:40:52.064819Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00934","last_updated":"2024-04-03T17:04:06Z","snapshot_observed_at":"2026-08-16T14:04:44.599558Z","submitted_at":"2024-04-01T05:39:36Z","title":"ChatGLM-RLHF: Practices of Aligning Large Language Models with Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00934","snapshot_observed_at":"2026-08-15T20:40:50.907728Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.907728Z"},"links":{"cited_paper":"/paper/2404.00934","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:9d29ccb0456b6f689748457d3fa52604aa5f161e041d41b3cf81bb44faaf9589","observation_id":"e737e666-7a83-4300-9e3b-36e2ea3d1156","resolution":{"observed_at":"2026-08-15T20:40:50.907728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.042951Z","title":null,"venue":null,"work_id":"3eb92cdb-909b-4be2-9f35-9d9fb2f6725b","year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.913755Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:f2955fbe79785bd334947ba68f0b10c143ae6ef0f2a219bf3e114b06c9ee0b64","observation_id":"64091380-0c4d-499a-88c7-2cc65c665442","resolution":{"observed_at":"2026-08-15T20:40:52.048184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:52.030715Z","title":null,"venue":null,"work_id":"f00a3a70-fa27-419f-b595-4f8e1d80dd4d","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.917328Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a2129b8548ebd846a5c89a945fd186813865ace9407c3b3341f826b709af1785","observation_id":"3d22dd6d-a93d-4c10-8afa-804870a03e2d","resolution":{"observed_at":"2026-08-15T20:40:52.034963Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04656","last_updated":"2025-06-09T07:10:33Z","snapshot_observed_at":"2026-08-19T04:57:34.223598Z","submitted_at":"2024-04-06T15:20:59Z","title":"Binary Classifier Optimization for Large Language Model Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04656","snapshot_observed_at":"2026-08-15T20:40:50.925689Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.925689Z"},"links":{"cited_paper":"/paper/2404.04656","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:6fd13e8f51283917470d59c9d6c0a44aebecae13ed0369e239455ea031705367","observation_id":"47a23641-f57b-43d9-9f82-e236fe6762c5","resolution":{"observed_at":"2026-08-15T20:40:50.925689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.930298Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.930298Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e0ac6842cecd5b72e05e4f421ae50dad5c60ed6ba2d866d81ed4d999f8378c0e","observation_id":"86856a6b-6237-4af2-9633-b6e380071d78","resolution":{"observed_at":"2026-08-15T20:40:50.930298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.934357Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.934357Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:bbe6da81592d6226cbe880d42c939081adda9c1c41c065c5da393381a738885d","observation_id":"6aa1d5a6-01f1-4674-ade9-824e5f66bcac","resolution":{"observed_at":"2026-08-15T20:40:50.934357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.992829Z","title":null,"venue":null,"work_id":"fa8da84a-0d36-430c-b0ec-dafce9f8fdb8","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.938542Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:696863d1f5618f0db8467019b6aee2d006dc334936308acc373dfc411f83d62b","observation_id":"fb60a56a-9752-4689-b4d8-4aafc65577d5","resolution":{"observed_at":"2026-08-15T20:40:51.997053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.971442Z","title":null,"venue":null,"work_id":"47267351-96bc-4cab-b6fe-bbf8ca91cdc9","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.942801Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:e546f065da34a834717a22a6d499ca9f0b63e2f0d9660071169a120284f9463c","observation_id":"def9d6f1-f470-4624-9326-390d6ca74ff0","resolution":{"observed_at":"2026-08-15T20:40:51.977717Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.956448Z","title":null,"venue":null,"work_id":"756b0ac1-6a22-4c57-add3-b4a4bc0aed99","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.946587Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a181a2359dd3f964ef3087b2b55a590c1fa4e11be514017b463aebf99c11b9b8","observation_id":"09bb4ae4-c9ce-4606-b18d-37193864672d","resolution":{"observed_at":"2026-08-15T20:40:51.962086Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.941316Z","title":null,"venue":null,"work_id":"7c216f2d-f1c7-4967-a03e-b00600da4178","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.950791Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0609d5105a5783e6ba4fbefd361366a6b9dd01c12785b654f664df2be8310a4a","observation_id":"1e676ca6-5bdd-43f4-8a58-c7692a3e7ea6","resolution":{"observed_at":"2026-08-15T20:40:51.947236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.928386Z","title":null,"venue":null,"work_id":"92e87d53-f359-4d33-aeff-b553138eff87","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.954528Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:82915a11716413cd0df625be2db55acd27491c38c5bd9b5fab73837ec1b34259","observation_id":"c00ec4d0-b2ef-47a8-89a7-c607f7bf04b7","resolution":{"observed_at":"2026-08-15T20:40:51.932469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.913335Z","title":null,"venue":null,"work_id":"36d23ac1-9bdc-4d7c-b67d-8c1fd4db568f","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.958054Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:9041d9109ff0cf6ef0c19fd37bd1141193179d6ff4ac199cf7ef10e95fbf96a7","observation_id":"0e12d145-60b5-4f3c-9dbe-a0d5970f7689","resolution":{"observed_at":"2026-08-15T20:40:51.918412Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.892809Z","title":null,"venue":null,"work_id":"f6d12b82-3d54-471e-983d-27971ccf22f5","year":2015},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.962897Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2f04ed75f7e27f4a4ee863163cceced703b31285497e3d92c66cf0c2e356064c","observation_id":"84318b56-4c45-4301-9e8b-d638dcc0259f","resolution":{"observed_at":"2026-08-15T20:40:51.897471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.877526Z","title":null,"venue":null,"work_id":"731f155b-71b3-4845-9355-3243b95c020b","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.966934Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:621089ba3c5d6e59f8465340401f827dc6c69268825e9630d852fe2a28cd1998","observation_id":"77eb1868-571e-4e4b-af4a-1eff649fad8c","resolution":{"observed_at":"2026-08-15T20:40:51.882737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.859857Z","title":null,"venue":null,"work_id":"2e588470-3aac-450d-a0d9-8042d4f7783d","year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.972276Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:49155372e595e736c1c2d8b9e50b8040c5cf5dca34055fad583717951a065401","observation_id":"965d54b0-6259-4bf6-8fca-4ef0fe17f6b9","resolution":{"observed_at":"2026-08-15T20:40:51.864918Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.847052Z","title":null,"venue":null,"work_id":"a003f74f-06fa-4025-b965-19e697a82468","year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.977632Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:325f4baedfac3e4ca80beec852dada1c2b3c2231ebb715af6dbe783b124a0dbc","observation_id":"942fabb0-3d12-44be-a1cb-3daa306aa7d5","resolution":{"observed_at":"2026-08-15T20:40:51.851855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:50.982935Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.982935Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:68718e26125be4dab38cb545f80df8969d6e280a6345eb5ecc29bf1b3c64cc04","observation_id":"74d4375e-5068-4b24-91ed-3e739cd9342e","resolution":{"observed_at":"2026-08-15T20:40:50.982935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.06411","last_updated":"2024-11-28T02:53:40Z","snapshot_observed_at":"2026-08-16T17:29:35.207164Z","submitted_at":"2024-09-10T10:49:38Z","title":"Length Desensitization in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.06411","snapshot_observed_at":"2026-08-15T20:40:50.986937Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.986937Z"},"links":{"cited_paper":"/paper/2409.06411","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:effa02a99a77815ca0434b8f717eeea70eb79c22afd7e7e5ea369372b655c27c","observation_id":"5e656f0a-fbf1-482a-b962-e892415a274b","resolution":{"observed_at":"2026-08-15T20:40:50.986937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10957","last_updated":"2024-12-09T09:57:05Z","snapshot_observed_at":"2026-08-16T17:34:09.727485Z","submitted_at":"2024-06-16T14:24:30Z","title":"Eliminating Biased Length Reliance of Direct Preference Optimization via Down-Sampled KL Divergence","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10957","snapshot_observed_at":"2026-08-15T20:40:50.995488Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:50.995488Z"},"links":{"cited_paper":"/paper/2406.10957","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:80bc1dddd5e45e9ce0b7b507a9ae9c3376a06fd5cc2d24fc34f5f9cacfe78947","observation_id":"1b480cfa-c648-4d8d-bf96-ab522ba28b53","resolution":{"observed_at":"2026-08-15T20:40:50.995488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.828836Z","title":null,"venue":null,"work_id":"20fa8651-9a54-424f-bac5-35375ce6a72a","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.000659Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:59831a46f0f98646a781d3c293c30f41fa585375c0c473473db9fbb697461b09","observation_id":"12f518c5-463d-403e-a1ca-bd2d435be68f","resolution":{"observed_at":"2026-08-15T20:40:51.834403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-15T20:40:51.008119Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.008119Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:510d5c75503224b5d2514b7af7176425f131d6183b45f6685ffd59a7a27e9c7c","observation_id":"92a9f314-f8e1-4876-961a-abe8abd24226","resolution":{"observed_at":"2026-08-15T20:40:51.008119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.013546Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.013546Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:4695d7f83de53a027aa6c85e89770ff939bbf57c16328f18ec54c9badfeb6eda","observation_id":"cb16990e-0a17-481b-b1cd-b241535b1e41","resolution":{"observed_at":"2026-08-15T20:40:51.013546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.803786Z","title":null,"venue":null,"work_id":"54bb1e9b-8cd2-47de-8060-4fb7cbf55900","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.017748Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b63011fcbe6e14c213d9cb1ba07e563f9d399156c1029752c3bbdd2ea52ec68f","observation_id":"e8b78292-e152-469a-a2af-8456842ab2a8","resolution":{"observed_at":"2026-08-15T20:40:51.809529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-08-14T02:18:02.339361Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-15T20:40:51.022359Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.022359Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b05b4a65cbcbc65e3e0dd1e80227a76d620ffc6684bbd61355bbedfdd6afc87c","observation_id":"49278843-dc57-447c-b1d9-14c11ea65aaf","resolution":{"observed_at":"2026-08-15T20:40:51.022359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.774477Z","title":null,"venue":null,"work_id":"2a49e0cf-b229-4701-9753-6a408d4f5f43","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.026456Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:61fec790e4ffc1cf5402f675bb238ffbd59a4f39702036fb82d34c33d2c889e1","observation_id":"99f2fd35-6031-488c-b7f2-e0848ffc7eb8","resolution":{"observed_at":"2026-08-15T20:40:51.782314Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.029963Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.029963Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:3eafcec4b5b390a1210a9260bbd71eb91146babc6ec3b3c6582408c24f202755","observation_id":"fdea8842-4847-4848-91b0-f0a4ad7b24d0","resolution":{"observed_at":"2026-08-15T20:40:51.029963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.750796Z","title":null,"venue":null,"work_id":"4a62562d-4bac-459f-99fa-2c00523b940b","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.033632Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b9702dec7ccaf602d164eb45b6ea0b9eab5a6a1d953fe860fdf61645c90b9742","observation_id":"8228630f-c1b9-4908-956a-89e889d6f0b3","resolution":{"observed_at":"2026-08-15T20:40:51.755221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.037648Z","title":"Ziegler, Ryan Lowe, Chelsea Voss, Alec Radford, Dario Amodei, and Paul Christiano","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.037648Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:0015f06465e4b5c835b44ea02e7a30c1e994dba836ed81cda824c646cc5442a1","observation_id":"836d6584-7f24-43b1-8f1d-123a3089bf19","resolution":{"observed_at":"2026-08-15T20:40:51.037648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.728225Z","title":null,"venue":null,"work_id":"e496dc5e-a66f-4a10-9bd2-450ef9c18f47","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.041091Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a904acb28ae56c4ea521bf53243a6b9722aafea7ede0f636dc7763621380da0d","observation_id":"2d82d505-afad-4a68-8a06-0e1a47508402","resolution":{"observed_at":"2026-08-15T20:40:51.734070Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.707000Z","title":null,"venue":null,"work_id":"4cef8a23-84a6-4b60-a37c-e1c4486fb3b1","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.044923Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:798175c426021d5df33601f6233fb0aa252c58a6672567ea233807282ff0f907","observation_id":"e944a157-1092-4098-a144-fa2293b4a557","resolution":{"observed_at":"2026-08-15T20:40:51.713537Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.687801Z","title":null,"venue":null,"work_id":"bd9e563f-0ffb-4c95-a5ea-ffc811210868","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.048927Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:85594e4487b7c12fff67781a52f68976a32992fd172da6a92535868940ec4aca","observation_id":"a2e21f24-4ebe-4d3d-aea4-1331488718ff","resolution":{"observed_at":"2026-08-15T20:40:51.692838Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-08-17T11:08:48.802438Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-15T20:40:51.052531Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.052531Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:b884051108631fecad236d59cba4f41124c485267ddb0f6cdb279ed39babd3b7","observation_id":"4f1a5d66-53c4-4c68-9a19-fcee577037de","resolution":{"observed_at":"2026-08-15T20:40:51.052531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-18T22:30:23.108990Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-15T20:40:51.057004Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.057004Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:156c223dc28067f0d48c7dcf641d490aefbadd0ab2fb99829d1ef5d7aba1b95e","observation_id":"113a36c2-1c1d-4bd1-90a2-8ee91dc66bb3","resolution":{"observed_at":"2026-08-15T20:40:51.057004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.668827Z","title":null,"venue":null,"work_id":"103fca1e-bf86-49a4-8c24-c4734b52b69c","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.062418Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:c6c7034803b262679f97eb419ab57e102b36a404786f6fa4d8ee5712891a8fbf","observation_id":"1520b3a5-d711-4471-96b0-0b2f6239d878","resolution":{"observed_at":"2026-08-15T20:40:51.676137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-15T20:40:51.068237Z","title":"P Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.068237Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:d1e5950d08e0e6772dc11e786e9b24bdc8aea4e09908b88bd643ae93663d93b7","observation_id":"a8cf8d9a-a90e-4cf7-b737-4486a5049f24","resolution":{"observed_at":"2026-08-15T20:40:51.068237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.651277Z","title":null,"venue":null,"work_id":"65791221-e444-4e9b-a802-a2747cac3e37","year":2022},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.075518Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:a0c1930af95849947a9851f96ec2c73a5e19e2ff957349df7adbb64cbc0cee21","observation_id":"0defa92a-6493-4a6c-9bc4-906b1bef0385","resolution":{"observed_at":"2026-08-15T20:40:51.658062Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-15T20:40:51.081237Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.081237Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2462651834a56cdb3eaab7bac8e9143c4c99c7e042842b1bdb1e454cc804115c","observation_id":"aaa0e2fa-95a2-4fb0-ab33-4a89672a7043","resolution":{"observed_at":"2026-08-15T20:40:51.081237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.634186Z","title":null,"venue":null,"work_id":"e473a919-7a82-49b7-849a-fb11ff391aec","year":2025},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.086789Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:2ab9d8caa12362ac8ab69f829ecfaf0eb2ad17531361d02a1441f546f904ba31","observation_id":"1affbfcb-9d5c-4c60-9272-42318ed6cca8","resolution":{"observed_at":"2026-08-15T20:40:51.640471Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:40:51.613344Z","title":null,"venue":null,"work_id":"ee3a91f0-728e-4ce8-84e6-a881b69273c4","year":2024},"citing_paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-15T20:40:51.092593Z"},"links":{"citing_paper":"/paper/2505.12435"},"observation_digest":"sha256:6f1bd69905f5677fc09abc0f4d2feaaec696f3f1e7296982a60e58f71d91ca82","observation_id":"9f7743f8-2322-41ee-8229-9f1467dd42ad","resolution":{"observed_at":"2026-08-15T20:40:51.619564Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12435","last_updated":"2025-05-18T14:19:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T18:52:24.021652Z","submitted_at":"2025-05-18T14:19:23Z","title":"SGDPO: Self-Guided Direct Preference Optimization for Language Model Alignment"},"reference_resolution":{"displayed":66,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":65,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":66},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 66 of 66 outbound references and 0 inbound Pith citation observations for arXiv:2505.12435."}