{"as_of":"2026-08-20T05:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c7de2d03881ebba22e04cd571173a1ac4802ad1ed35963c504d7baf2b3c51c52","coverage":[{"denominator":12,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":12,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T17:54:26.542958Z","state":"measured"},{"denominator":12,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":12,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20133/citation-record","integrity":"/paper/2507.20133/integrity","json":"/paper/2507.20133/citation-record.json","paper":"/paper/2507.20133"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2406.18346","last_updated":"2024-06-26T13:42:13Z","snapshot_observed_at":"2026-08-16T13:39:25.407269Z","submitted_at":"2024-06-26T13:42:13Z","title":"AI Alignment through Reinforcement Learning from Human Feedback? Contradictions and Limitations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18346","snapshot_observed_at":"2026-08-15T17:54:26.500695Z","title":"arXiv preprint arXiv:2406.18346","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.500695Z"},"links":{"cited_paper":"/paper/2406.18346","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:5598a05f44fab6d70acb7a90454bc9da685d8f16e72043d9e549957f8cfaf687","observation_id":"95e95346-6727-40db-90e9-842654018759","resolution":{"observed_at":"2026-08-15T17:54:26.500695Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07595","last_updated":"2025-06-13T12:47:42Z","snapshot_observed_at":"2026-08-16T17:39:27.653354Z","submitted_at":"2024-11-12T07:09:44Z","title":"Entropy Controllable Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07595","snapshot_observed_at":"2026-08-15T17:54:26.507754Z","title":"arXiv preprint arXiv:2411.07595","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.507754Z"},"links":{"cited_paper":"/paper/2411.07595","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:6792ee2bf8b7dafebe1a2e3e16876877e91b836fe18995b35f84ed8ce3c276b4","observation_id":"6b249688-81cc-4792-99d5-303bfac6a3a9","resolution":{"observed_at":"2026-08-15T17:54:26.507754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19159","last_updated":"2024-09-09T04:39:31Z","snapshot_observed_at":"2026-08-16T14:05:38.679805Z","submitted_at":"2024-03-28T06:03:47Z","title":"Disentangling Length from Quality in Direct Preference Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19159","snapshot_observed_at":"2026-08-15T17:54:26.513629Z","title":"Advances in Neural Information Processing Systems, 35:27730–27744","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.513629Z"},"links":{"cited_paper":"/paper/2403.19159","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:ccb315a52e00cd20efdd321eaa28262b621837ce680d75a3d6a541117de4ec46","observation_id":"ade77db5-f931-4a63-8a69-74c51116f0bb","resolution":{"observed_at":"2026-08-15T17:54:26.513629Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-15T17:54:26.518764Z","title":"arXiv preprint arXiv:2305.18290","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.518764Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:fb300bb6c838aef8abd883b0444280fc5298e7c22a500cbb32405cb2ac70e8f8","observation_id":"7699e76f-f7c0-423e-9396-ebf1a485146a","resolution":{"observed_at":"2026-08-15T17:54:26.518764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T17:54:26.523900Z","title":"arXiv preprint arXiv:2411.04712","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.523900Z"},"links":{"citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:7fa94d28aada95edbb73a8296ca131d4a7372d802121d421477a2082347082fd","observation_id":"a7a8ee54-fc26-48af-97f1-dba559aa856a","resolution":{"observed_at":"2026-08-15T17:54:26.523900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00030","last_updated":"2025-07-07T20:24:43Z","snapshot_observed_at":"2026-08-18T16:57:45.001223Z","submitted_at":"2025-02-24T22:43:21Z","title":"RSPO: Regularized Self-Play Alignment of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00030","snapshot_observed_at":"2026-08-15T17:54:26.531019Z","title":"arXiv preprint arXiv:2503.00030","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.531019Z"},"links":{"cited_paper":"/paper/2503.00030","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:1a1fae6a13b2f0f3ef67f259c7bcff96822d83caef0dd49f7da3fbe2ac548c87","observation_id":"822f6461-fac5-43b8-a6c7-0771abc94bf4","resolution":{"observed_at":"2026-08-15T17:54:26.531019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16240","last_updated":"2023-09-28T08:29:44Z","snapshot_observed_at":"2026-08-19T00:14:01.230491Z","submitted_at":"2023-09-28T08:29:44Z","title":"Beyond Reverse KL: Generalizing Direct Preference Optimization with Diverse Divergence Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16240","snapshot_observed_at":"2026-08-15T17:54:26.537395Z","title":"In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recog- nition, pages 8228–8238","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.537395Z"},"links":{"cited_paper":"/paper/2309.16240","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:f947fb758916bcdd1049926e61e3e21dd0fb42ba66123510ff8ae19208406bf8","observation_id":"8934c5be-c620-4ef0-b3b4-b4cf842d666f","resolution":{"observed_at":"2026-08-15T17:54:26.537395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14836","last_updated":"2025-08-25T02:40:51Z","snapshot_observed_at":"2026-08-16T17:39:02.377899Z","submitted_at":"2024-09-23T09:09:16Z","title":"Orthogonal Finetuning for Direct Preference Optimization","version":3},"cited_work":{"arxiv_id":"2409.14836","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.14836","snapshot_observed_at":"2026-08-15T17:54:26.593976Z","title":"Orthogonal Finetuning for Direct Preference Optimization","venue":"cs.CL","work_id":"75bd923a-7916-4192-a996-18b130455eab","year":2024},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.542958Z"},"links":{"cited_paper":"/paper/2409.14836","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:36bfa452959bcbb108621789cfadd182724baa8fc8bf18c8c65b1b5803276609","observation_id":"165200ea-805e-4b0e-82ac-54fe1e5aeda6","resolution":{"observed_at":"2026-08-15T17:54:26.601911Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-15T17:54:26.471746Z","title":"arXiv preprint arXiv:2204.05862","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.471746Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:5da19ea263cc6dd915cfc6dfa11c18d57af08527dcb422ce7b32285e9090c95b","observation_id":"a80da313-aa7a-4318-ac82-292c3282deec","resolution":{"observed_at":"2026-08-15T17:54:26.471746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-15T17:54:26.493999Z","title":"rlhf: Scaling reinforcement learn- ing from human feedback with ai feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.493999Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:590f90aef8451b0947218ed8ff0dd1f65682d1715b5ca77c215af42fd416b233","observation_id":"dc8ecfaa-e4ca-4fde-9767-b4d0cdf7e45c","resolution":{"observed_at":"2026-08-15T17:54:26.493999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13542","last_updated":"2024-07-18T09:00:23Z","snapshot_observed_at":"2026-08-20T03:31:35.446193Z","submitted_at":"2024-06-19T13:29:53Z","title":"Self-play with Execution Feedback: Improving Instruction-following Capabilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13542","snapshot_observed_at":"2026-08-15T17:54:26.479849Z","title":"arXiv preprint arXiv:2406.13542","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.479849Z"},"links":{"cited_paper":"/paper/2406.13542","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:c7378d6e4f9102f07a191373e9869c5ca0fe682fb1c6698d3bf16252177dd262","observation_id":"2c11746e-2098-4200-bd06-e9bbc5f8ce73","resolution":{"observed_at":"2026-08-15T17:54:26.479849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.02882","last_updated":"2025-07-14T09:56:47Z","snapshot_observed_at":"2026-08-19T04:52:45.265808Z","submitted_at":"2025-04-02T05:47:28Z","title":"DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models","version":2},"cited_work":{"arxiv_id":"2504.02882","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.02882","snapshot_observed_at":"2026-08-15T17:54:26.872985Z","title":"DiaTool-DPO: Multi-Turn Direct Preference Optimization for Tool-Augmented Large Language Models","venue":"cs.CL","work_id":"5029d738-9614-45db-9aa9-0968b6a870f7","year":2025},"citing_paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T17:54:26.488087Z"},"links":{"cited_paper":"/paper/2504.02882","citing_paper":"/paper/2507.20133"},"observation_digest":"sha256:0790a9fe24082e172b928584462fd2821ce4aa32649ac50361ee1de515bf5b8d","observation_id":"ef8f7377-8197-47fa-945b-04a680345a5e","resolution":{"observed_at":"2026-08-15T17:54:26.877988Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.20133","last_updated":"2025-07-29T04:18:09Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-19T20:16:25.769168Z","submitted_at":"2025-07-27T05:20:13Z","title":"Sem-DPO: Mitigating Semantic Inconsistency in Preference Optimization for Prompt Engineering"},"reference_resolution":{"displayed":12,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":12},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 12 of 12 outbound references and 0 inbound Pith citation observations for arXiv:2507.20133."}