{"as_of":"2026-08-08T11:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71a2ba66f73eee0d97ba0e3c9ae15b424ca61ec56870849556b7419d45bc0e57","coverage":[{"denominator":49,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":49,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T06:05:32.728004Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.11098/citation-record","integrity":"/paper/2506.11098/integrity","json":"/paper/2506.11098/citation-record.json","paper":"/paper/2506.11098"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.520994Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.520994Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:5190c57ac7c6b3c3fd772698bf8a90c971628574b2f039112023e86fa9a83df8","observation_id":"97cd3f7b-566b-455b-9cdd-a3f0b49084f3","resolution":{"observed_at":"2026-08-07T06:05:32.520994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.526128Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.526128Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:c61f2c6780676419cbb514cc18d7a4abff172560b52acab5220aa5e355a01aeb","observation_id":"c393ac49-6827-468f-9471-6b4e1b397011","resolution":{"observed_at":"2026-08-07T06:05:32.526128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.531806Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.531806Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:de51cd2f469db36b2ddec98f19bdf8d2f08b075f69f3a3ab5e6866f5cc32701a","observation_id":"b14c64b4-b5fe-4978-a3d5-703f650aecdc","resolution":{"observed_at":"2026-08-07T06:05:32.531806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.528426Z","title":null,"venue":null,"work_id":"187882fb-a838-4e7c-96f4-2034cc53620f","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.536525Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:419524d213fb25dbb1fb9e7eda03dd4d369e4e019ce149e2a6de366323bc4c16","observation_id":"a67aad3a-e58a-4e61-a615-7a741689fdc0","resolution":{"observed_at":"2026-08-07T06:05:33.532490Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.514044Z","title":null,"venue":null,"work_id":"11cf3ad8-5095-4b2a-a6f6-a69ec9505461","year":2020},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.540968Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:d234d313348600a27a276337dcda6139a4c2933474b7671bb7684e91926913dd","observation_id":"2acc3515-d81f-4cc2-8512-0b46352bdb5c","resolution":{"observed_at":"2026-08-07T06:05:33.518687Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00861","last_updated":"2021-12-09T21:40:22Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-01T22:24:34Z","title":"A General Language Assistant as a Laboratory for Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00861","snapshot_observed_at":"2026-08-07T06:05:32.545630Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.545630Z"},"links":{"cited_paper":"/paper/2112.00861","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:d8fa4e424bed8f6af752283ec5b582e3770e8c040d41a7d308197dc17e97a157","observation_id":"44a430db-54fa-440b-b31f-c752a6d5620a","resolution":{"observed_at":"2026-08-07T06:05:32.545630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.498732Z","title":null,"venue":null,"work_id":"65bdff01-b127-4e87-bc08-87fd2f550de6","year":2009},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.550254Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:9efaa1b98f65f2ec0176f33fdfe86760c0c957174ff1b46ea9abde05cb70aecf","observation_id":"54f27b40-29ad-4e25-8375-2ab3cc997f5a","resolution":{"observed_at":"2026-08-07T06:05:33.504015Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:32.554671Z","title":null,"venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.554671Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:9047333b64ca68f92ecf8f26e9e2c816d6dd2fe8c5598e58ed34175a595e41fe","observation_id":"4638ed7e-9013-4d13-a010-f0d005282a97","resolution":{"observed_at":"2026-08-07T06:05:32.554671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.475274Z","title":null,"venue":null,"work_id":"5284bd4e-7966-4790-a274-8c7202ce26eb","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.558585Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:e22bf95190af4bb30f245df2afbc6401b10c56fb48f2e5d25616f4e4c8132940","observation_id":"1fa1e298-330f-4b76-91a0-94a7d1af9242","resolution":{"observed_at":"2026-08-07T06:05:33.479058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.461794Z","title":null,"venue":null,"work_id":"53961a09-b0e8-40ce-9702-268baf9c6732","year":2017},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.563093Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:66acc105c430c8cf73eaa406ce47ada7830370df8bf5fdfe396cd67dd20262cd","observation_id":"39cd5008-b9f1-45cb-b3e0-b8c2368a4106","resolution":{"observed_at":"2026-08-07T06:05:33.466212Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-02T07:46:40.319683Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-07T06:05:32.567554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.567554Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:0b0fa8eb63f82a48fa6133434808820b9f5698ee6827fca97adccb2e14b0c99f","observation_id":"15bfb751-8677-430a-ba9e-c97906086dd8","resolution":{"observed_at":"2026-08-07T06:05:32.567554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.448454Z","title":null,"venue":null,"work_id":"6a8d3a94-34bd-44a4-a521-fb92f07d2e39","year":2013},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.572066Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:a8317c8148b9eb21e7bcf9ccb1f75145ba786bbcb4f25725379c582f75694bfe","observation_id":"37b32f76-af8f-48b6-844a-3ffdeb628b8b","resolution":{"observed_at":"2026-08-07T06:05:33.452443Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-07T06:05:32.576314Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.576314Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:dc4da98d602b90a05d93ff9bf45a6fde5be847415bb3d554b775681fc508ff4e","observation_id":"14915f7f-eb95-403e-91cc-6af505725a08","resolution":{"observed_at":"2026-08-07T06:05:32.576314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-07T08:32:00.916309Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-07T06:05:32.580792Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.580792Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:707dd41413b399e541a23198f73ebbc2be698a5b35c7c6c160e9540734f162ce","observation_id":"bbe05557-40df-4a4b-a544-a963a7750947","resolution":{"observed_at":"2026-08-07T06:05:32.580792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T06:05:32.585102Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.585102Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:9e6dca26f159262af7a764e070d2959162ea1d96e4296438d93faabff8afa857","observation_id":"67bf7084-0174-4fcb-99f5-a281574c56aa","resolution":{"observed_at":"2026-08-07T06:05:32.585102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-07T06:05:32.589245Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.589245Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:9eacd7b567779496720576f4433dd1760041bc545d47dc72e5cbc4b4929e2021","observation_id":"0209bffc-0395-4431-9978-bde3421de69e","resolution":{"observed_at":"2026-08-07T06:05:32.589245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.434674Z","title":null,"venue":null,"work_id":"3aecabee-6eba-40cc-b000-f4b412a71905","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.593625Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:49b06dfe39b7952ee9a6e254f566ae80ae19d18466aef2276b743bd38ea14216","observation_id":"ec8188f9-2433-4f22-a2bf-cdf944df81a2","resolution":{"observed_at":"2026-08-07T06:05:33.438711Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.421382Z","title":null,"venue":null,"work_id":"78bb53b3-6fc6-493f-abcb-f415f3c2851d","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.598590Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:7f5236226ebf13f9d84129d213d6c291fa979cfec108581c988e44551aad707d","observation_id":"4a59ccb9-e276-465a-8636-d63bbbbe37c0","resolution":{"observed_at":"2026-08-07T06:05:33.425259Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-07T06:05:32.603244Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.603244Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:0ca2d1f4cb9e5ff6309cb8369004cf0879cc557aeba1651eef60ff5fd909bcb4","observation_id":"af5dfd71-9369-4733-ac9b-992386de1f21","resolution":{"observed_at":"2026-08-07T06:05:32.603244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.408290Z","title":null,"venue":null,"work_id":"9ba6cf12-b0fd-480b-a7b6-6f77f06e63b7","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.607485Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:229ef1bb0dc63d78dc241ba93b59ee1c20bcd0fe1464ee927c4e6329efdda2a2","observation_id":"df7810e6-6911-4b53-9744-df9bc024dc31","resolution":{"observed_at":"2026-08-07T06:05:33.412157Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.395268Z","title":null,"venue":null,"work_id":"14781b01-f3a7-4e87-afcc-b0fee785ead1","year":2025},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.611469Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:07a6f27386d431a04a0cf4bd242b8bf7ba63ea79b1142e9c0729d6e1756c5ed0","observation_id":"231ed846-a0a5-4267-8112-b3975ad68ce0","resolution":{"observed_at":"2026-08-07T06:05:33.399238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.381692Z","title":null,"venue":null,"work_id":"0765916a-a3d7-4f64-84a4-9a0b1bcfdd09","year":2020},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.615612Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:25844f66c0b350a1581878b49a257b712c2f0d65b3a06f990f28117caf79f479","observation_id":"b44231d1-45fd-4c50-8cbb-88ba9410d503","resolution":{"observed_at":"2026-08-07T06:05:33.385631Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.368138Z","title":null,"venue":null,"work_id":"31fd3f9b-9d9c-4a8e-ae24-79e6b288cb6f","year":2015},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.619403Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:1f48acc823074f0e21fff38487a23139e1dc4e98f0a5b81b734adb0f41f5fcdd","observation_id":"2c603c55-2ae5-4eba-ab22-10ea4b4bced8","resolution":{"observed_at":"2026-08-07T06:05:33.372321Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.353968Z","title":null,"venue":null,"work_id":"d05a8173-d5f1-4086-af88-51ec9fc5a236","year":2022},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.623578Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:1e2ef5ae7592242ffd1ee3cb9c1d9cce59c1a4d23bd15cd318c7a98fe4fc7998","observation_id":"3955dbab-d44d-4b18-82f6-e7a3f4bea961","resolution":{"observed_at":"2026-08-07T06:05:33.358683Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.340008Z","title":null,"venue":null,"work_id":"ad725b98-890d-457b-a56b-87ec2433e217","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.627509Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:1b26b2b3d48875edf88eb4b997f1c647a5f8cd6c5505c1ee70e85f0d89a3fb72","observation_id":"94169d60-021c-4f72-8000-9e67f334bd5d","resolution":{"observed_at":"2026-08-07T06:05:33.343913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11296","last_updated":"2024-02-17T14:34:31Z","snapshot_observed_at":"2026-08-03T22:30:44.718770Z","submitted_at":"2024-02-17T14:34:31Z","title":"Dissecting Human and LLM Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11296","snapshot_observed_at":"2026-08-07T06:05:32.631391Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.631391Z"},"links":{"cited_paper":"/paper/2402.11296","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:490513749bad61fd38d742474479c9bf3a10b931168fab5139ef628d81638b88","observation_id":"7c27b1ca-6f27-474e-8f27-021ee75597fa","resolution":{"observed_at":"2026-08-07T06:05:32.631391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T06:05:32.635828Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.635828Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:0b701f21e70488d990c5680a2c6fb1be06af57f8708aff1a0266157d1f99bb7c","observation_id":"4cd640aa-6fef-45cd-ab5a-98e22d37fa91","resolution":{"observed_at":"2026-08-07T06:05:32.635828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.326585Z","title":null,"venue":null,"work_id":"14c157d4-53b6-4a48-81b3-9dc5f6145913","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.639794Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:5ca6d14cbb777e3a2c2877854ebd9269c2fa176a88845cb91dff24773e85ff46","observation_id":"6c8ed455-6fc1-4c28-9a79-47d7443ba863","resolution":{"observed_at":"2026-08-07T06:05:33.330752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2410.06965","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.010192Z","title":null,"venue":null,"work_id":"340d45b2-e8b1-4239-afa7-02b08d7ed6d2","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.643899Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:06f3f22b076e651053c6954bec4cc79d810c2b949a825bfb6e41a3ed702fcebf","observation_id":"0050e4e5-2c19-42df-b80a-5aefc823c192","resolution":{"observed_at":"2026-08-07T06:05:33.018292Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T06:05:32.647804Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.647804Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:3208e380dab13c86198cda2f3999f513a1889b160cecc1d067b963ac6905ab9e","observation_id":"134dfb4e-b7b2-4554-a56a-0ec9ccb4fb01","resolution":{"observed_at":"2026-08-07T06:05:32.647804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.312922Z","title":null,"venue":null,"work_id":"9adcb359-816c-49de-a2e1-0e2c6f537999","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.651800Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:3a5aef28380d0a76f18f17a2b5d07427941a2e667894f133cc784e3e940f12e4","observation_id":"0d800e66-12e2-4516-a0b7-70f26436693b","resolution":{"observed_at":"2026-08-07T06:05:33.316887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.299410Z","title":null,"venue":null,"work_id":"f696950b-8f97-423a-b418-78fb52b0fc02","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.656381Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:5e2243fca2a31133dfb3a35d76027e04a4dd5cbd1c2cd6f7e260ca0263067c86","observation_id":"c16bedea-7899-4537-b161-7e33e1cf8054","resolution":{"observed_at":"2026-08-07T06:05:33.303371Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.284666Z","title":null,"venue":null,"work_id":"3456f2f1-7cef-4303-84c6-e5c65125bbde","year":2022},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.660320Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:44bb32ac3851fc444213d2749a0c8b96af452b4fe19b928f1876f763d48a7e27","observation_id":"e3c64ba8-a585-434f-8d09-81744b4e0b12","resolution":{"observed_at":"2026-08-07T06:05:33.289403Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.271285Z","title":null,"venue":null,"work_id":"b093a29a-674c-4c4e-b080-98537b869979","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.664289Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:07f6e91dd4e815e1c92c52660f88c1afe276f4e81f7fe8c62a82dfac420dcebc","observation_id":"7ccfae8f-eb6d-4547-99b4-4b9439e73479","resolution":{"observed_at":"2026-08-07T06:05:33.275333Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.258096Z","title":null,"venue":null,"work_id":"e05b5300-f520-4960-be24-beafe33125a5","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.668431Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:7c866308e87aea4cd7e9f91ffc16be10adb9e45fbb6bee4cf76c877284b73dc5","observation_id":"0449bcc5-cd22-43c8-8a98-5a9be9064e05","resolution":{"observed_at":"2026-08-07T06:05:33.262059Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03715","last_updated":"2024-04-04T17:56:41Z","snapshot_observed_at":"2026-08-05T22:29:52.212015Z","submitted_at":"2024-04-04T17:56:41Z","title":"Direct Nash Optimization: Teaching Language Models to Self-Improve with General Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03715","snapshot_observed_at":"2026-08-07T06:05:32.672178Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.672178Z"},"links":{"cited_paper":"/paper/2404.03715","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:502789769870a667c367151c6bac678a659ec391ee655cc78e5cfbf228e10b95","observation_id":"0fc2bec0-5495-40c1-a5e9-18cfb280fb3c","resolution":{"observed_at":"2026-08-07T06:05:32.672178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03716","last_updated":"2024-07-10T23:15:49Z","snapshot_observed_at":"2026-08-03T14:09:43.107865Z","submitted_at":"2023-10-05T17:38:28Z","title":"A Long Way to Go: Investigating Length Correlations in RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03716","snapshot_observed_at":"2026-08-07T06:05:32.676825Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.676825Z"},"links":{"cited_paper":"/paper/2310.03716","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:57d3b0629e3297d774247f902f16b0a7e85b88a005f50721510d0977c326cb58","observation_id":"a3844b5c-fc83-4018-b6a9-5f94054c4f26","resolution":{"observed_at":"2026-08-07T06:05:32.676825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.243100Z","title":null,"venue":null,"work_id":"6bd2873d-31fb-4563-9fde-0b686f9e3dac","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.680958Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:d4392eed1e04966548e2ece825236f272d42a1919391901dd43211e365ef5328","observation_id":"c1ca1cb8-b1c0-4130-afcc-3099e44ece02","resolution":{"observed_at":"2026-08-07T06:05:33.248054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.227919Z","title":null,"venue":null,"work_id":"4bc6d976-f2e8-44d5-84c1-eb676d896721","year":2020},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.685213Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:a45dfe24c9c70075e82b8263c22988c0de5b3b6b0b5031644f3d367756987737","observation_id":"0b4f36e2-831a-4a94-b610-5e9d3d917d0f","resolution":{"observed_at":"2026-08-07T06:05:33.232005Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T06:05:32.689590Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.689590Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:8db841835572c17b6735dd84954a554fcd3dbf93b03357d1453779f1e176db71","observation_id":"362a54b7-755f-4ab6-b9d8-4a615b1153db","resolution":{"observed_at":"2026-08-07T06:05:32.689590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-07T06:05:32.693883Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.693883Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:e7dcea0fe4fb0f99f667bd8fb95aa54eac69c9ce2e0491b52961b5e5bcf88ab2","observation_id":"242ee8b0-5754-4c86-9e0e-6a9315e892ae","resolution":{"observed_at":"2026-08-07T06:05:32.693883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.213662Z","title":null,"venue":null,"work_id":"bb1b2626-9e07-4f8a-b551-0f27527a0777","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.698505Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:28c369d5a3dcb05b8802885dbc737680358c7f9003a4106629f84177952fbcc0","observation_id":"fdd9d55c-10bc-41fe-9be2-aeac5ce84b3b","resolution":{"observed_at":"2026-08-07T06:05:33.218139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.197959Z","title":null,"venue":null,"work_id":"9994357a-29f1-4db2-8cf6-549b01115d82","year":2022},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.703255Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:30b247674641392218a03382bb94cf4eb53920836a1cbe67d13853fbc1fe1ebe","observation_id":"9192bb21-5105-4608-9b76-1f00beb25dc1","resolution":{"observed_at":"2026-08-07T06:05:33.202246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00675","last_updated":"2024-10-04T18:48:25Z","snapshot_observed_at":"2026-07-31T03:54:43.196039Z","submitted_at":"2024-05-01T17:59:20Z","title":"Self-Play Preference Optimization for Language Model Alignment","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00675","snapshot_observed_at":"2026-08-07T06:05:32.707537Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.707537Z"},"links":{"cited_paper":"/paper/2405.00675","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:ebbdb18546e03988d75a6cf55446b5fed88af48b4cec6ffc9ec9e6ead8e233ac","observation_id":"0d0b9669-c8b2-4b83-8629-aa35d4e4397f","resolution":{"observed_at":"2026-08-07T06:05:32.707537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.184109Z","title":null,"venue":null,"work_id":"e59a4a3a-5368-4851-88ee-8a547fb0c976","year":2024},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.711756Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:721b595d766acccbcae7e7e6f3c1c02121a2b3a15592309ae387cbf8ea9cc9eb","observation_id":"944ea925-9df0-422d-bede-ecfb6cef2c23","resolution":{"observed_at":"2026-08-07T06:05:33.188133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16682","last_updated":"2024-04-22T22:51:32Z","snapshot_observed_at":"2026-08-06T05:33:43.589358Z","submitted_at":"2023-12-27T18:53:09Z","title":"Some things are more CRINGE than others: Iterative Preference Optimization with the Pairwise Cringe Loss","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16682","snapshot_observed_at":"2026-08-07T06:05:32.715738Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.715738Z"},"links":{"cited_paper":"/paper/2312.16682","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:4b83c442b1c9eea538a9b88830fb910627afa880b9b1e43fccdbbfab60580576","observation_id":"8a00e02c-ef7c-4cd6-b98f-5b30ad389630","resolution":{"observed_at":"2026-08-07T06:05:32.715738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10425","last_updated":"2023-05-17T17:57:10Z","snapshot_observed_at":"2026-08-02T06:11:08.013358Z","submitted_at":"2023-05-17T17:57:10Z","title":"SLiC-HF: Sequence Likelihood Calibration with Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10425","snapshot_observed_at":"2026-08-07T06:05:32.720004Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.720004Z"},"links":{"cited_paper":"/paper/2305.10425","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:dcaf4ce801f2950da45b325c2360148d7123d3c1e6f9952c65734a6ebad46feb","observation_id":"9520ea74-8889-43c0-bd1b-372e99a61b44","resolution":{"observed_at":"2026-08-07T06:05:32.720004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T06:05:33.170054Z","title":null,"venue":null,"work_id":"fd624d99-38b7-4823-abb7-be3e4a913f63","year":2023},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.724090Z"},"links":{"citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:95c26bb8b8caa138fcb7e720476e58e8106922389c1766d676fc5b27b2409244","observation_id":"0bea02bf-8970-4335-b3c0-29668a3e6023","resolution":{"observed_at":"2026-08-07T06:05:33.174460Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-07T06:05:32.728004Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T06:05:32.728004Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2506.11098"},"observation_digest":"sha256:06f2fc5c1a600fb0c0ca6275b622e45bd5968dcee8e320a7f9c72f76949c7e5c","observation_id":"385a7655-4429-4b52-86ac-4b787c317a94","resolution":{"observed_at":"2026-08-07T06:05:32.728004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.11098","last_updated":"2025-06-06T13:19:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T09:29:26.176523Z","submitted_at":"2025-06-06T13:19:07Z","title":"Debiasing Online Preference Learning via Preference Feature Preservation"},"reference_resolution":{"displayed":49,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":49},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 49 of 49 outbound references and 0 inbound Pith citation observations for arXiv:2506.11098."}