{"as_of":"2026-08-10T08:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4e688a5f86e1dbc6df14adac44f8a5f94df630c635b5752aae29320361375725","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:52:27.322147Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.22851/citation-record","integrity":"/paper/2509.22851/integrity","json":"/paper/2509.22851/citation-record.json","paper":"/paper/2509.22851"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.10571","last_updated":"2024-06-06T12:02:37Z","snapshot_observed_at":"2026-07-06T17:31:04.675896Z","submitted_at":"2024-02-16T10:55:38Z","title":"Direct Preference Optimization with an Offset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10571","snapshot_observed_at":"2026-08-04T14:52:18.602366Z","title":"Amini, T","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.602366Z"},"links":{"cited_paper":"/paper/2402.10571","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:8797806fb9b6d7e3bec93936e579ca3eab545af24b88192f6802be79693dad39","observation_id":"d26ae2f7-df07-4591-ab61-cb299ee78d85","resolution":{"observed_at":"2026-08-04T14:52:18.602366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12036","last_updated":"2023-11-22T00:02:49Z","snapshot_observed_at":"2026-08-09T07:24:36.881438Z","submitted_at":"2023-10-18T15:21:28Z","title":"A General Theoretical Paradigm to Understand Learning from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12036","snapshot_observed_at":"2026-08-04T14:52:18.668425Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.668425Z"},"links":{"cited_paper":"/paper/2310.12036","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:91545045c2dd4eab04a0ca83de86551cb672b3a125641b6ac44fd3c787e15017","observation_id":"4deb9cf5-bfb4-4a4e-a885-a13706c67041","resolution":{"observed_at":"2026-08-04T14:52:18.668425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:18.815293Z","title":"Bousquet, S","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.815293Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:07fe666c3f9b1b2ff1b27b0e7eb8116b3dca49d2ce1ac08759e0d09085002d28","observation_id":"40e0d324-70e7-478c-8376-f3279d3e5fbb","resolution":{"observed_at":"2026-08-04T14:52:18.815293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:18.874694Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:18.874694Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c06221f2391bec28b6084143c545d6e1b9709d98dc48e633b3014ce24b3e9e41","observation_id":"931f9ebc-bfbc-4231-8f18-1f5a1edb4f66","resolution":{"observed_at":"2026-08-04T14:52:18.874694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.014491Z","title":"Burton, M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.014491Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:7605d434e444cde706a6ac01b1132f6b7ae43db5aea3ad2b18baa40af0492461","observation_id":"a0d963fd-66b3-4871-b322-c35f6d0c173c","resolution":{"observed_at":"2026-08-04T14:52:19.014491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08266","last_updated":"2025-06-09T22:03:56Z","snapshot_observed_at":"2026-08-10T01:49:26.719459Z","submitted_at":"2025-06-09T22:03:56Z","title":"Reinforcement Learning from Human Feedback with High-Confidence Safety Constraints","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08266","snapshot_observed_at":"2026-08-04T14:52:19.102106Z","title":"Chittepu, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.102106Z"},"links":{"cited_paper":"/paper/2506.08266","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:77d7b22f6b691d1989ce32c7dfd25a12c2e5c90f86d43627aa1aa9762e87a3ce","observation_id":"32637181-00ce-4796-a516-eaa778829233","resolution":{"observed_at":"2026-08-04T14:52:19.102106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.230754Z","title":"Cortes and V","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.230754Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3aea9eb6c3b768a549fb946bb0efd86b9e73cf2717ba429ac3f2828be9cda98c","observation_id":"b5410bf6-2633-4911-bb22-02f398f49f7f","resolution":{"observed_at":"2026-08-04T14:52:19.230754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-04T14:52:19.341056Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.341056Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:376c0b3bb5f780b1c33ed748815e261ed96ab24bd0b7ad2d2ae40c74822ed3fc","observation_id":"5b0d4bfe-b7ad-411a-ac61-fff73e42d8f6","resolution":{"observed_at":"2026-08-04T14:52:19.341056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-02T16:56:38.535065Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-04T14:52:19.488335Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.488335Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:af09e3f27d13772ae8073c67d6f10f3f42b0082784a9cbd79011bee08348aa77","observation_id":"3e996b52-e079-416a-b208-9bc0465b48fd","resolution":{"observed_at":"2026-08-04T14:52:19.488335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-04T14:52:19.641786Z","title":"Dubois, B","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.641786Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:479b7cc3f681aaf6af9ee33c7913cdfe10a9bb1803cdad0937a27600ec01f081","observation_id":"ffbc1c1f-7249-426c-9576-bb1c3d3078bc","resolution":{"observed_at":"2026-08-04T14:52:19.641786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.721322Z","title":"Freund, R","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.721322Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:fd648cb8dce10807b0b71462ec7eb01144b87f6ec550d3a691bc66f972aa1691","observation_id":"c9f67d72-0320-4973-874b-7c2fa63207ed","resolution":{"observed_at":"2026-08-04T14:52:19.721322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:19.829631Z","title":"Grattafiori et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.829631Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:fa26e37d076d2c611dea36ec7bd0d4851fab45426bdbd8808c2b1055469121fc","observation_id":"bdc8121d-fda6-4bc6-b99a-12aa39ffd21d","resolution":{"observed_at":"2026-08-04T14:52:19.829631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06187","last_updated":"2021-07-13T15:37:20Z","snapshot_observed_at":"2026-08-05T01:22:37.562624Z","submitted_at":"2021-07-13T15:37:20Z","title":"Deep Ranking with Adaptive Margin Triplet Loss","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06187","snapshot_observed_at":"2026-08-04T14:52:19.927431Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:19.927431Z"},"links":{"cited_paper":"/paper/2107.06187","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e5030a2573fbe5406883d019a4ea969bcf1f91a012bc978d5c2b5e3d5a6412b1","observation_id":"2e7b1d4a-22e4-4918-a44a-4d50c35ee4ea","resolution":{"observed_at":"2026-08-04T14:52:19.927431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.063810Z","title":null,"venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.063810Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:c25ee78e7718b99bdb5fee3482e837a42a9f5ce807f747742c59d2436a5311f0","observation_id":"b135e933-e8ff-4e02-a62b-2745286621fe","resolution":{"observed_at":"2026-08-04T14:52:20.063810Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1049/cp:19991223","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Herbrich and J","venue":null,"work_id":"ed75dc60-6a47-4c8c-be4e-86d4ce450461","year":1999},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.143671Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:04b4468e76a90ce4284bda4d7780e690a776a47b89ee8d148702ba2cd14738b6","observation_id":"07170c3e-662a-4c99-8ea6-9f5da5ce5873","resolution":{"observed_at":"2026-08-04T14:53:21.597770Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.216813Z","title":"Huang, Y","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.216813Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:372c96dc22418e37f5cdd67c9e40a637dacd3fc074007c0abc111d2418a686ee","observation_id":"5cc9a423-2cf1-48c2-a280-0d7b0eabde7b","resolution":{"observed_at":"2026-08-04T14:52:20.216813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.00456","last_updated":"2019-07-08T17:21:46Z","snapshot_observed_at":"2026-07-06T08:03:53.351060Z","submitted_at":"2019-06-30T20:53:19Z","title":"Way Off-Policy Batch Deep Reinforcement Learning of Implicit Human Preferences in Dialog","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.00456","snapshot_observed_at":"2026-08-04T14:52:20.301947Z","title":"Jaques, A","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.301947Z"},"links":{"cited_paper":"/paper/1907.00456","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:0350bc34c49d55aa3fc9c7fbd0262c7678483ce1cf27a09db6bd1167ae167638","observation_id":"bcb942e4-821c-45b6-b63f-d85de30a8e5b","resolution":{"observed_at":"2026-08-04T14:52:20.301947Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01765","last_updated":"2017-12-05T17:13:48Z","snapshot_observed_at":"2026-07-06T06:12:53.767037Z","submitted_at":"2017-12-05T17:13:48Z","title":"Best-Worst Scaling More Reliable than Rating Scales: A Case Study on Sentiment Intensity Annotation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01765","snapshot_observed_at":"2026-08-04T14:52:20.420279Z","title":"Kiritchenko and S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.420279Z"},"links":{"cited_paper":"/paper/1712.01765","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:b051393c9dffd6f39aea9edf0250550e31830cfb448acf9685f38132351d61f6","observation_id":"7fa6e70b-4141-4aea-b59c-03c5577fc3fa","resolution":{"observed_at":"2026-08-04T14:52:20.420279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13787","last_updated":"2024-06-08T16:40:12Z","snapshot_observed_at":"2026-08-02T18:11:57.036767Z","submitted_at":"2024-03-20T17:49:54Z","title":"RewardBench: Evaluating Reward Models for Language Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13787","snapshot_observed_at":"2026-08-04T14:52:20.583374Z","title":"Lambert, V","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.583374Z"},"links":{"cited_paper":"/paper/2403.13787","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:1df07ef87d89a60aa889f64a53a5ad003165e9a050da3d470e2f6ff5fd6d4b89","observation_id":"1e925bf3-af47-4214-bfe5-5b02f232054a","resolution":{"observed_at":"2026-08-04T14:52:20.583374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.699279Z","title":"Ledoux and M","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.699279Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:0dc9637b3f55facf1209169f86d7175356add767587f62181a0f80412d9d75af","observation_id":"aa2d5130-5b08-4c55-bbb2-df410334c849","resolution":{"observed_at":"2026-08-04T14:52:20.699279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:20.899020Z","title":"Ouyang, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:20.899020Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:ef48e9f639cec7b24a2cbb9d6bdacd204ee451e7542bb6c788f94cdaa888bf64","observation_id":"c0f3625f-7d29-4853-98e3-d2093ffff08a","resolution":{"observed_at":"2026-08-04T14:52:20.899020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:21.057847Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.057847Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:b204969652cb0ab15707c24220b6456e9f46615ac8d488741a99a429df63b25a","observation_id":"ab919cad-b1d9-4238-8dfc-285aae93f89d","resolution":{"observed_at":"2026-08-04T14:52:21.057847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:21.262596Z","title":"Peters and S","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.262596Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:da2130992ac96197120dd81ceef6d69c8ca10b911e690bc8189e3487af2fb24b","observation_id":"fa7afd46-3c23-46f2-9c88-84e69c0d9b98","resolution":{"observed_at":"2026-08-04T14:52:21.262596Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04932","last_updated":"2024-04-07T12:10:04Z","snapshot_observed_at":"2026-07-06T17:56:44.412445Z","submitted_at":"2024-04-07T12:10:04Z","title":"Towards Understanding the Influence of Reward Margin on Preference Model Performance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04932","snapshot_observed_at":"2026-08-04T14:52:21.427999Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.427999Z"},"links":{"cited_paper":"/paper/2404.04932","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:d5ec8b6caae1b2e4d4aa2276cdd20857c14aeca552973d763bec069c5451bbf1","observation_id":"fdbcda8b-ed8c-43ae-9c2f-8b4c3593c9c2","resolution":{"observed_at":"2026-08-04T14:52:21.427999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02900","last_updated":"2024-11-05T01:44:14Z","snapshot_observed_at":"2026-07-06T18:25:35.827334Z","submitted_at":"2024-06-05T03:41:37Z","title":"Scaling Laws for Reward Model Overoptimization in Direct Alignment Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02900","snapshot_observed_at":"2026-08-04T14:52:21.625861Z","title":"Rafailov, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.625861Z"},"links":{"cited_paper":"/paper/2406.02900","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:d7a3be57341e057a1201ee376f361e371fabddd32750b5e4207c6116f0e6b493","observation_id":"3b0f04f9-5a26-44f5-aa62-e5839e6ae26b","resolution":{"observed_at":"2026-08-04T14:52:21.625861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-04T14:52:21.762269Z","title":"Rafailov, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.762269Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9377da84b6f107e6f4fbe328ce40baa31e30ecb49ad0df96a4f4a21cd0da6778","observation_id":"3d63d4ca-da49-4ff5-b230-8f1f9c880fcc","resolution":{"observed_at":"2026-08-04T14:52:21.762269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:21.915511Z","title":null,"venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:21.915511Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3c8ca92fb3d74bd44e0e5063cbe24a641f70577dcc90532dfe2a2e2e0b830ea8","observation_id":"7e076658-0a5c-4316-a66f-74e70d1cae92","resolution":{"observed_at":"2026-08-04T14:52:21.915511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:22.048055Z","title":"Shalev-Shwartz and S","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.048055Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:14fc0a9e35843149a9c14463e9a463804be5bab8f5542ba0c171da1a46137336","observation_id":"03cac645-6536-4014-9036-d4ab7967df3a","resolution":{"observed_at":"2026-08-04T14:52:22.048055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.01325","last_updated":"2022-02-15T19:09:36Z","snapshot_observed_at":"2026-08-06T19:18:51.065158Z","submitted_at":"2020-09-02T19:54:41Z","title":"Learning to summarize from human feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.01325","snapshot_observed_at":"2026-08-04T14:52:22.241257Z","title":"Stiennon, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.241257Z"},"links":{"cited_paper":"/paper/2009.01325","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:162ead85c9c47b010b828842463b5706ed7b79324bf7ea3ebd4776fb9d08716f","observation_id":"b2c2bc61-a198-446a-9200-9fa6941cfa6a","resolution":{"observed_at":"2026-08-04T14:52:22.241257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:22.403138Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.403138Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:64ae87765e9e26017ec51b89609b20fd886fe56538fd3311d477470571967ddc","observation_id":"35854391-623f-4756-b624-e2e1b12ea2ed","resolution":{"observed_at":"2026-08-04T14:52:22.403138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-04T14:52:22.474124Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.474124Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9c744e67814c4ef1778fb23d89592f6ebae1a8922f1baa0ed73e8dcb62a64877","observation_id":"62422090-11c8-440a-9b8b-5b9b17d101ae","resolution":{"observed_at":"2026-08-04T14:52:22.474124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14770","last_updated":"2025-06-19T20:59:14Z","snapshot_observed_at":"2026-08-06T14:17:07.046149Z","submitted_at":"2023-05-24T06:19:14Z","title":"Using Natural Language Explanations to Rescale Human Judgments","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14770","snapshot_observed_at":"2026-08-04T14:52:22.663086Z","title":"Wadhwa, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.663086Z"},"links":{"cited_paper":"/paper/2305.14770","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:30afa0044b4285f16e0a02f810a7666619b2da0a0395f1fa900f45205a8e4f0c","observation_id":"ad48c468-41f6-4d02-b234-1c325540d4b9","resolution":{"observed_at":"2026-08-04T14:52:22.663086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06080","last_updated":"2024-01-12T09:46:10Z","snapshot_observed_at":"2026-08-09T19:07:54.536460Z","submitted_at":"2024-01-11T17:56:59Z","title":"Secrets of RLHF in Large Language Models Part II: Reward Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06080","snapshot_observed_at":"2026-08-04T14:52:22.806003Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.806003Z"},"links":{"cited_paper":"/paper/2401.06080","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9a2375ac364b10bd94481d606df8fc70ce8ec5271f4370086e9bb11e878308da","observation_id":"6e2155e5-e488-4033-a71f-79949deb1a4c","resolution":{"observed_at":"2026-08-04T14:52:22.806003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09385","last_updated":"2024-10-30T04:47:00Z","snapshot_observed_at":"2026-08-05T09:30:42.939323Z","submitted_at":"2024-08-18T07:04:16Z","title":"Reward Difference Optimization For Sample Reweighting In Offline RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09385","snapshot_observed_at":"2026-08-04T14:52:22.977912Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:22.977912Z"},"links":{"cited_paper":"/paper/2408.09385","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:72c2cb3ed9802b797e2007700dd09c35df18964d22f393da8a66cea8403879e1","observation_id":"930e524d-670e-4629-90cb-11db64921b0a","resolution":{"observed_at":"2026-08-04T14:52:22.977912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:23.152384Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.152384Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:383c6a058829db2bdfd39744a9b248167b0ee19e0932159539e71759f8c68830","observation_id":"a8ebfb0e-6e6d-484e-99f7-8832427597a9","resolution":{"observed_at":"2026-08-04T14:52:23.152384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-07-06T19:25:42.156795Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-04T14:52:23.416543Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.416543Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:4936bce235dda45d0a2bd0b6abdf55330c172630b496d0162051bac5a27ebd05","observation_id":"b4039719-d289-4f68-abe4-e1b8e027db86","resolution":{"observed_at":"2026-08-04T14:52:23.416543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10148","last_updated":"2025-07-19T03:40:37Z","snapshot_observed_at":"2026-07-31T17:19:15.491176Z","submitted_at":"2024-10-14T04:29:57Z","title":"AlphaDPO: Adaptive Reward Margin for Direct Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10148","snapshot_observed_at":"2026-08-04T14:52:23.506011Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.506011Z"},"links":{"cited_paper":"/paper/2410.10148","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e9699a46472d8cd1e5a4dcea4ba64a995cf537a25733b66171292ef974cfab08","observation_id":"9402494a-17ff-40a8-a70f-fee6e656ded9","resolution":{"observed_at":"2026-08-04T14:52:23.506011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08639","last_updated":"2024-10-13T08:53:00Z","snapshot_observed_at":"2026-07-06T18:44:57.578408Z","submitted_at":"2024-07-11T16:21:18Z","title":"$\\beta$-DPO: Direct Preference Optimization with Dynamic $\\beta$","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08639","snapshot_observed_at":"2026-08-04T14:52:23.688099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.688099Z"},"links":{"cited_paper":"/paper/2407.08639","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:008d56c004124d9ac1ef077c7809649381d54336353c289a7c457780fdc679ee","observation_id":"34d1da5e-9660-4de1-8f71-242207ba596a","resolution":{"observed_at":"2026-08-04T14:52:23.688099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:23.753724Z","title":"Zhang, R","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.753724Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:59e58e77c7d1584ce51ae12c0b46a69228ece320818d6097dc7ad2dcf6259020","observation_id":"a7872236-7bbf-40f2-a2a6-75a9f0eeba6e","resolution":{"observed_at":"2026-08-04T14:52:23.753724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-04T14:52:23.843777Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.843777Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:1bcb25b750fe3c35e1085d29a7de6d1a90c40a1f0c090a1cfb8023720fa787a1","observation_id":"dca28929-3147-44b8-80dc-00812939bbea","resolution":{"observed_at":"2026-08-04T14:52:23.843777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:23.913195Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.913195Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:08ecd0025b50219dd28d54f6e40081bcae8095790e294f9119b412481ce8d2e3","observation_id":"4195abd2-6dd2-466c-9378-df0b02df4e4e","resolution":{"observed_at":"2026-08-04T14:52:23.913195Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.005140Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.005140Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3e5a5f02904d0baafc398b12d83da918c556466affa5b3febdff3e4f4efbd802","observation_id":"33823365-27bd-4322-a321-50012d02e943","resolution":{"observed_at":"2026-08-04T14:52:24.005140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.136944Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.136944Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:f3a11f1be63ab6440e0313181ed227122c678cbbdd28944c4256744ce5d1b061","observation_id":"ba6ec33e-dac8-4464-aa14-a986278fc4ac","resolution":{"observed_at":"2026-08-04T14:52:24.136944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.264276Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.264276Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e54f590a24e6dfa7c3833c179f20aaadcf8abf200d72a40e63e79574c10e2f56","observation_id":"ae76b861-3e3a-4385-bd13-6c4d87631726","resolution":{"observed_at":"2026-08-04T14:52:24.264276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.415800Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.415800Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:ffc1b01831d589616962651b68b7c2b8855125ac798ee37faa0d1cf58b0c2832","observation_id":"b183f1b7-2860-4c41-9765-ed3591a2c7a1","resolution":{"observed_at":"2026-08-04T14:52:24.415800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.575574Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.575574Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:cd8fb41d5ea600771b0f9839c2e756b375a98a72a2a77b39b9fbc3f79da91610","observation_id":"becc15a5-a966-456d-8d73-6f5e5ae7094f","resolution":{"observed_at":"2026-08-04T14:52:24.575574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.676764Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.676764Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:a6933b1df049952cf049bb57fcd72f61d93a43c866cb48efc410110fa01bbf06","observation_id":"18a40dff-31c5-4a95-99fd-589c4fa50ef3","resolution":{"observed_at":"2026-08-04T14:52:24.676764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.819696Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.819696Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:2509d30b1bd2173af998fb839f1f4b9de9ad906a8eae89f6e7d4b44dd4634a5f","observation_id":"df5b5ed2-91a0-4b42-8d8f-32f52c2bc217","resolution":{"observed_at":"2026-08-04T14:52:24.819696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:24.935392Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:24.935392Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:0f058fca0018fcc5e2581071091b26eb9e86ca0db5e6dbed5f1ce76fbab1ef21","observation_id":"46703fff-72b9-4720-a0e6-e0bbc6f9801b","resolution":{"observed_at":"2026-08-04T14:52:24.935392Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.028667Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.028667Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:76ecbaec508d5b225c21f88324b6596fe1090c5c0b08dc142e5854a0f3de14bb","observation_id":"19396117-59ba-4b42-89df-68333583a515","resolution":{"observed_at":"2026-08-04T14:52:25.028667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.184988Z","title":"Trailer Park","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.184988Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9342bea0107ef7423cf09632370b3020d9d5622a6c90b752fe73b51db0ddfbe4","observation_id":"6c25a5f6-86cc-4ca9-958b-055af1d78953","resolution":{"observed_at":"2026-08-04T14:52:25.184988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.276801Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.276801Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:036f7eb7d0a449d4767bb7abe4451206e4c26b8c71f588e6b7ba3a6ef9d85c86","observation_id":"0eacef87-9bdd-47b8-be7e-b47458e2265c","resolution":{"observed_at":"2026-08-04T14:52:25.276801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.390652Z","title":"It comes in various toppings including classic pepperoni but also more unique options such as cathead (a combination of prosciutto and arugula)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.390652Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:e8fc4eba42cd2639dd144fae9eb2c8b3f0aa409c121ae57c2ad4032632c9e5ea","observation_id":"4f33b784-df1c-4897-9197-736c156c6e89","resolution":{"observed_at":"2026-08-04T14:52:25.390652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.463887Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.463887Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:81f80ea5f42950e86516e3e8c3ed22417f9f768ea3584149e5324f8a8a9050a7","observation_id":"7d7a2a36-3ae1-4e81-a092-4ef92aa583cb","resolution":{"observed_at":"2026-08-04T14:52:25.463887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.585139Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.585139Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3d40b61d7e8e13addbdfa0a586ee867c0bfcda2ba0db0b7a1d2ebfe104be1c84","observation_id":"f0047949-78bb-42c4-bc94-29c180a70d5a","resolution":{"observed_at":"2026-08-04T14:52:25.585139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.732076Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.732076Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:381b6cea8a0acb5853fb17b3f82e3e19f98d8e2a0d1bc8bc7c27e999696ab651","observation_id":"dd6a007a-d963-4e73-a11e-2c5528730d26","resolution":{"observed_at":"2026-08-04T14:52:25.732076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.833263Z","title":"These are just a taste of what Austin has to offer when it comes to street food culture","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.833263Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:fbd75dc4f3febd2f1250d9dd319380ba7e0e6e7e47927afabdc3e24b6b4cb645","observation_id":"bd327419-9064-4441-8af6-cc07ab337fd8","resolution":{"observed_at":"2026-08-04T14:52:25.833263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:25.929612Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:25.929612Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:3af310d1a70182413bec9c04b9930ca6e13fbc73596c48cc58f8d1bfa0dc337f","observation_id":"43a863ae-88c2-437f-a5b5-9639a4e27c6a","resolution":{"observed_at":"2026-08-04T14:52:25.929612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.034237Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.034237Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:51f86b674fb36b45c00f70245e709db9a5557ef622c8a2a822849034ae077c74","observation_id":"1b523c27-65b4-49c9-aa95-71dd2e7c5d37","resolution":{"observed_at":"2026-08-04T14:52:26.034237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.120585Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.120585Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:8360dc1771fdd911f7fc461f9783bf8ff8f053d293a8c4044838b377d38d4d19","observation_id":"80c953cb-459c-4c94-bb2d-d88893718526","resolution":{"observed_at":"2026-08-04T14:52:26.120585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.249371Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.249371Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:bf46a3e9d2c6e7a48718609c6d874e561deffb7e6f5a4a39083ab583e711eef7","observation_id":"80241729-884a-4899-a568-d88f50667a00","resolution":{"observed_at":"2026-08-04T14:52:26.249371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.362875Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.362875Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:d62184375144b277c4866df6da0e41e3720cfee5d0b0daa365f1f33a4adc3263","observation_id":"42c6f05d-10b4-494e-83b3-bee6ed28f842","resolution":{"observed_at":"2026-08-04T14:52:26.362875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.511683Z","title":"Big As Yo´Face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.511683Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:0d6bde9e56835d2d8380960f73e985c2c802f9e32f1a06f1eedbe7f467959e9d","observation_id":"28510f25-63f7-410c-94b6-ecd3adb4bb55","resolution":{"observed_at":"2026-08-04T14:52:26.511683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.714613Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.714613Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:55f0c3b363078ad31334e4dd990ec180a7b35dae12e77bf3f145329e42eb28cf","observation_id":"62559684-b2ae-41ab-aea6-8b968a5a706c","resolution":{"observed_at":"2026-08-04T14:52:26.714613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:26.922954Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:26.922954Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:cea0773f9e3159abe1863a0b92a2c65c4ac32944484d8c020852fd72b6651545","observation_id":"600040fb-d03d-4019-8689-363ce8530dba","resolution":{"observed_at":"2026-08-04T14:52:26.922954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:27.059039Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:27.059039Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:499e3876c1cc754ad7386e258bf1222e14434715f15588867fce7747ddc8956c","observation_id":"cb8e8394-cc1c-4420-8ac0-4f9e068db294","resolution":{"observed_at":"2026-08-04T14:52:27.059039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:27.204351Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:27.204351Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:8327b8936b56d8cd2496f14caa6429bdd6d29f412af50a878c70ecaf9ef4c110","observation_id":"a5b037e6-d769-4eca-9431-eee23b86fe8c","resolution":{"observed_at":"2026-08-04T14:52:27.204351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T14:52:27.322147Z","title":"Lion Burgers,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:27.322147Z"},"links":{"citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:54c6c83ef223d88d789351551d1b04f7b9e041e5818cae6fad01725f1082d416","observation_id":"7fb140ae-8efa-435e-8c29-f93029f42f82","resolution":{"observed_at":"2026-08-04T14:52:27.322147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09528","last_updated":"2023-11-16T03:13:29Z","snapshot_observed_at":"2026-08-10T01:44:07.896255Z","submitted_at":"2023-11-16T03:13:29Z","title":"HelpSteer: Multi-attribute Helpfulness Dataset for SteerLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09528","snapshot_observed_at":"2026-08-04T14:52:23.326087Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences","version":4},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T14:52:23.326087Z"},"links":{"cited_paper":"/paper/2311.09528","citing_paper":"/paper/2509.22851"},"observation_digest":"sha256:9837e8ff4e6f5c828f4a1eab6568c46f8df3e058f8e1a8c78200c36a4e67040b","observation_id":"cc987b26-76a4-4d61-82ee-429d539bd995","resolution":{"observed_at":"2026-08-04T14:52:23.326087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.22851","last_updated":"2026-07-02T18:42:52Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-09T07:25:07.650510Z","submitted_at":"2025-09-26T19:03:24Z","title":"Adaptive Margin RLHF via Preference over Preferences"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":66,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2509.22851."}