{"as_of":"2026-08-08T12:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2852df323b4fe005ece4ae08fbd0167bd5ab7841adb2c5ba2dd7c9f16823fa3d","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:07:35.625982Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.03557/citation-record","integrity":"/paper/2506.03557/integrity","json":"/paper/2506.03557/citation-record.json","paper":"/paper/2506.03557"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.485605Z","title":"A general theoretical paradigm to understand learning from human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.485605Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:329706f163172f3c94c7d798fea699c613822c7b44f59835ab4e2ea40578370e","observation_id":"e5950ee1-ad35-435a-b45e-7accb3e99048","resolution":{"observed_at":"2026-08-07T11:07:35.485605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-07T11:07:35.490833Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback.arXiv preprint arXiv:2204.05862, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.490833Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:2d137b9bea3270f22af3c14f300911b931ff9e0ae95ab20e48422299b1bd531f","observation_id":"f3974c4a-bf03-4ccf-9eb7-ad3e028f6862","resolution":{"observed_at":"2026-08-07T11:07:35.490833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.129152Z","title":"Bradley and Milton E","venue":null,"work_id":"cd659471-c498-4d94-b782-e603fead7955","year":1952},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.496675Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:0b083f4b42c4cc57839df94f690aec61decf0488d90e2797fffbe449cc8f1405","observation_id":"e15453b3-d4dd-4897-8f13-766193e0a113","resolution":{"observed_at":"2026-08-07T11:07:36.133739Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.112730Z","title":"Christiano, Jan Leike, Tom B","venue":null,"work_id":"a8e924c3-2505-4dba-9d4f-963fe9c8dfcc","year":2017},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.501795Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:9896a30b549bfef4cbb0795f4df39267f36846f7efd494fdfade7ed1deba66e2","observation_id":"8e2dfe17-bf77-4f5d-84bf-98628c0f0223","resolution":{"observed_at":"2026-08-07T11:07:36.117449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T11:07:35.511097Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.511097Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:237610eab3fe7454cf43786ee33270bec42cb916c68903c51ab39f47a3f057c1","observation_id":"206d22a5-23d9-499f-845a-c3e075efd8a1","resolution":{"observed_at":"2026-08-07T11:07:35.511097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.096245Z","title":"Model alignment as prospect theoretic optimization","venue":null,"work_id":"67692a4f-6bd0-49c3-88d3-0a1261ed984d","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.516121Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:6f12c7c43db1a923e1740df96b08162bb2f74f0aa55060454e17ed34b863b183","observation_id":"7d895142-cc54-4c2f-9968-50909c9aae6e","resolution":{"observed_at":"2026-08-07T11:07:36.101078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.080134Z","title":"Olympiadbench: A challenging benchmark for promoting AGI with olympiad-level bilingual multimodal scientific problems","venue":null,"work_id":"5623b500-3a4f-470b-a0cd-cf9b167d04ed","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.521120Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:8a65d28fbbc4f0634f49150eda509105fd59407da6ac11fa92a6a19d6d8dfdaf","observation_id":"e5742135-7f18-4600-b5fa-a099ec757e78","resolution":{"observed_at":"2026-08-07T11:07:36.084841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.526189Z","title":"Measuring mathematical problem solving with the MATH dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.526189Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:7efaab21b56812e4d3956744d31f5c3707824de4e8c09c843547e355821ee0a8","observation_id":"9d2fa7ae-b1fa-4363-862e-47de82b4b06a","resolution":{"observed_at":"2026-08-07T11:07:35.526189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-07T11:07:35.531217Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model.arXiv preprint arXiv:2503.24290, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.531217Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:c92ce34d40ed222b2571c8678917fabe017ce3e091923783d9a0f95f055b42c5","observation_id":"0c5d7277-ac09-46ff-ba0b-e9ce2e6f52af","resolution":{"observed_at":"2026-08-07T11:07:35.531217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:07:35.536884Z","title":"Goucher, and et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.536884Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:d3bba2d6462aa9b6989d2d1bac17c574d0feae992154c0dfb7721e8b5263b94e","observation_id":"9b54130d-a35a-43f2-8238-0200e750e39f","resolution":{"observed_at":"2026-08-07T11:07:35.536884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.053136Z","title":"Smith, Yejin Choi, and Hanna Hajishirzi","venue":null,"work_id":"25146e9d-f650-4ef9-8b21-154a766adfc0","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.541847Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:7d03df6b45b9afa5b1a698afffce50b46b2cd763de81376021c63a96fd8faf90","observation_id":"42713f56-de29-4ef6-88d9-65a1bbef4e6b","resolution":{"observed_at":"2026-08-07T11:07:36.057918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.035343Z","title":"Ramasesh, Ambrose Slone, Cem Anil, Imanol Schlag, Theo Gutman-Solo, Yuhuai Wu, Behnam Neyshabur, Guy Gur-Ari, and Vedant Misra","venue":null,"work_id":"cad21e7b-2047-4d0e-8c7b-ef751b956882","year":2022},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.546416Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:a776b368dad6c34346b8f5862993250a6e1d01d66999b37d0cd5805b180c433d","observation_id":"f48ca749-2555-4439-8d9b-b906c9031993","resolution":{"observed_at":"2026-08-07T11:07:36.040876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:36.013457Z","title":"Mitigating the alignment tax of RLHF","venue":null,"work_id":"b9b80373-79ce-4e96-8137-4dd7e0a17268","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.550615Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:4b3ec66076345679de9a7081f0afbaf6526347593607c8a218d7e3fe9275836e","observation_id":"473d34a4-8559-4511-b02f-13f0fb36e1f7","resolution":{"observed_at":"2026-08-07T11:07:36.017881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.997535Z","title":"Liu, and Jialu Liu","venue":null,"work_id":"a723dcdb-fca5-477e-ad17-2028e99d23f8","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.554964Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:91ebbdfc6826a8fd97ccb3d87ec26c8dd491d03506209036cba37d61867a8d16","observation_id":"d9fca5fb-4421-44c9-b46f-ce16871d4c3e","resolution":{"observed_at":"2026-08-07T11:07:36.001899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17931","last_updated":"2024-05-28T07:53:40Z","snapshot_observed_at":"2026-07-06T18:21:09.808086Z","submitted_at":"2024-05-28T07:53:40Z","title":"Online Merging Optimizers for Boosting Rewards and Mitigating Tax in Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17931","snapshot_observed_at":"2026-08-07T11:07:35.563139Z","title":"Online merg- ing optimizers for boosting rewards and mitigating tax in alignment.CoRR, arXiv preprint arXiv:2405.17931, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.563139Z"},"links":{"cited_paper":"/paper/2405.17931","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:3ec4ddb8d46025d1bc67474acc9f4fc8b56ce53378ba530ca1879b54b5a63225","observation_id":"cd2b8c06-7a06-490c-919e-87236fc078f3","resolution":{"observed_at":"2026-08-07T11:07:35.563139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.966516Z","title":"Mankowitz, Doina Precup, and Bilal Piot","venue":null,"work_id":"a0a64416-f346-4c42-866f-49f9e5fe4f00","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.567906Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:4bfb1259f32f89b8a126a8f5aab365e92630951144cd246076e1d3f4193254dd","observation_id":"076167b2-c41a-4115-a719-d5d8db6f08a1","resolution":{"observed_at":"2026-08-07T11:07:35.970965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.950891Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"9e4b6e59-1495-4324-aebd-218affaf76f1","year":2022},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.572108Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:dd761f6413d2c4a48bb88868c1320d119eec09ac9c153a84cc799b81c2369ab4","observation_id":"3600ca7a-a6cc-4e69-9115-59b0436bb9d7","resolution":{"observed_at":"2026-08-07T11:07:35.956335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13228","last_updated":"2024-07-03T13:46:33Z","snapshot_observed_at":"2026-07-31T05:05:41.080329Z","submitted_at":"2024-02-20T18:42:34Z","title":"Smaug: Fixing Failure Modes of Preference Optimisation with DPO-Positive","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13228","snapshot_observed_at":"2026-08-07T11:07:35.576714Z","title":"Smaug: Fixing failure modes of preference optimisation with dpo-positive.arXiv preprint arXiv:2402.13228, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.576714Z"},"links":{"cited_paper":"/paper/2402.13228","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:0a12f1e20829ce1b7cb6435cbb33660706ae192ead1dcb53c246fbf93658d750","observation_id":"e2924f18-9bb9-4ea1-a250-7dba680a2c2a","resolution":{"observed_at":"2026-08-07T11:07:35.576714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.581612Z","title":"Manning, Stefano Ermon, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.581612Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:16b46e79e3d2f380f33cc35088a494ca115aa306605437b5bb25d9ad611c7884","observation_id":"f05344bb-5d1b-4041-ad1d-4162e15c0862","resolution":{"observed_at":"2026-08-07T11:07:35.581612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14723","last_updated":"2025-02-08T16:29:14Z","snapshot_observed_at":"2026-07-06T18:04:08.777507Z","submitted_at":"2024-04-23T03:55:01Z","title":"Insights into Alignment: Evaluating DPO and its Variants Across Multiple Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14723","snapshot_observed_at":"2026-08-07T11:07:35.586376Z","title":"Insights into alignment: Evaluating DPO and its variants across multiple tasks.arXiv preprint arXiv:2404.14723, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.586376Z"},"links":{"cited_paper":"/paper/2404.14723","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:88a641b5c2127be430b07c28956bcdb8ddfaff5872dfb268ca40000fa72bf899","observation_id":"631117fe-0c0c-415f-9f38-53bf08418ae9","resolution":{"observed_at":"2026-08-07T11:07:35.586376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.591108Z","title":"Ziegler, Ryan Lowe, Chelsea V oss, Alec Radford, Dario Amodei, and Paul F","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.591108Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:5fe9e6f537413a0624674a255bcbc3d942a02c31fc299c130394cb0f07ff4ee6","observation_id":"2e60a435-eee6-4934-9705-3076e36ab609","resolution":{"observed_at":"2026-08-07T11:07:35.591108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.595929Z","title":"Generalized preference optimization: A unified approach to offline alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.595929Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:d07d868850bd1cfa05fb5ccda43cc34169ff4db67901ce8d81064ee5140754eb","observation_id":"f0838878-0a6b-45c3-a985-f6dd2b9d34f1","resolution":{"observed_at":"2026-08-07T11:07:35.595929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.600673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.600673Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:fb9d8e664be6318a2d0d22f2c8b8fb1b85eac4a6487f3f3a198fc11ae65e671f","observation_id":"cb73d625-993f-4164-9794-65d8dca20cb4","resolution":{"observed_at":"2026-08-07T11:07:35.600673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.884861Z","title":"Contrastive preference optimization: Pushing the bound- aries of LLM performance in machine translation","venue":null,"work_id":"b7f46df5-e29d-4f60-a746-8d0358b009d4","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.605409Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:c846927ff9f04ae31113957321c057b85766824d5a2ad3e2097cc7b6c57fa74a","observation_id":"df8e9244-c3c7-46ba-a09c-fdefdbd65d6f","resolution":{"observed_at":"2026-08-07T11:07:35.889562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.868714Z","title":"Is DPO superior to PPO for LLM alignment? A comprehensive study","venue":null,"work_id":"9a07e629-050d-4918-8222-017d044af4b3","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.609927Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:1cc1becb2a131cbcfa9b23cdc7276f37d9de2c1d42619b7c8028a43074d0e389","observation_id":"30d500de-f698-43bd-a336-8e2b867414d7","resolution":{"observed_at":"2026-08-07T11:07:35.873245Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:07:35.615063Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.615063Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:7dab8d4750dd681ca956f55ce26dcafe0a21ef8b35eb574ed55d5d375691c818","observation_id":"ee9aeee2-2e93-44d4-981d-6d58fae6594e","resolution":{"observed_at":"2026-08-07T11:07:35.615063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T11:07:35.619682Z","title":"Limitations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.619682Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:7ee5ba3ce0e567462e7d9a2dd77e8e28f6b2e4e828e3eacd74d43cb32392831b","observation_id":"e928c41e-609e-4942-909e-de9dc75b6c28","resolution":{"observed_at":"2026-08-07T11:07:35.619682Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.848371Z","title":"Guidelines: • The answer NA means that the paper does not involve crowdsourcing nor research with human subjects","venue":null,"work_id":"eb34f697-e7e6-4fda-bf0a-39e2421de9e2","year":2025},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.625982Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:7072e4e8167b0eaef3ffd12dfc40ca4dcc888889084d909dca4efd9d65ec6002","observation_id":"7aa043a6-3a0b-4006-8b71-1094c7bd69dd","resolution":{"observed_at":"2026-08-07T11:07:35.855307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:07:35.981861Z","title":null,"venue":null,"work_id":"cc3c2cc8-61bb-4a61-b0ba-acb00c277b43","year":2024},"citing_paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:07:35.558965Z"},"links":{"citing_paper":"/paper/2506.03557"},"observation_digest":"sha256:758c4b4cd6cdd4d1cddd56e3d18d5e5242d3dbee83bcf08a74dee8eb2ab8d57b","observation_id":"d9bb6598-2471-4399-a008-d5c62c8262ff","resolution":{"observed_at":"2026-08-07T11:07:35.986800Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03557","last_updated":"2025-06-04T04:21:01Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T10:57:49.038310Z","submitted_at":"2025-06-04T04:21:01Z","title":"BPO: Revisiting Preference Modeling in Direct Preference Optimization"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":14,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2506.03557."}