{"as_of":"2026-08-16T22:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b1d8dfb36ff68a543a919d6871ea1359787430bc627b11d1f03dd4051899525","coverage":[{"denominator":20,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:18:40.431498Z","state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.01706/citation-record","integrity":"/paper/2505.01706/integrity","json":"/paper/2505.01706/citation-record.json","paper":"/paper/2505.01706"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2211.11602","last_updated":"2022-11-21T16:00:31Z","snapshot_observed_at":"2026-08-16T17:36:31.228792Z","submitted_at":"2022-11-21T16:00:31Z","title":"Improving Multimodal Interactive Agents with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.11602","snapshot_observed_at":"2026-08-16T04:18:39.907673Z","title":"Improving multi- 9 modal interactive agents with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.907673Z"},"links":{"cited_paper":"/paper/2211.11602","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:7c5eee840d3ac088e0426c98146861e3e221d9e9979f15a3544c516c6eff2e45","observation_id":"da9d4998-f419-4811-846d-12cbe65310da","resolution":{"observed_at":"2026-08-16T04:18:39.907673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-16T04:18:39.947889Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.947889Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:0884e8f9f22e583977c9ceba3ae9a0d683e36cd6f0a385de371edc439eeeca67","observation_id":"17a81456-0a56-4f8f-8587-92106ba508e9","resolution":{"observed_at":"2026-08-16T04:18:39.947889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:39.952368Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.952368Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:1fc54823b2c8d457f1cdf4138f86109e484cbcdcf937a4689b5d4c2bd5e5aaf8","observation_id":"5b48d90a-eaa2-442c-beb9-bcc31db1c918","resolution":{"observed_at":"2026-08-16T04:18:39.952368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-16T04:18:39.956959Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:39.956959Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:b6c3fefd811186cba83ed29f4799faa7e7fb0d6c41097d19ff9e6d9c6dcd1d07","observation_id":"213a1309-5cca-4770-b8a1-14dfdeba5ee6","resolution":{"observed_at":"2026-08-16T04:18:39.956959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00409","last_updated":"2024-04-12T01:09:37Z","snapshot_observed_at":"2026-08-16T15:35:06.002888Z","submitted_at":"2024-03-01T09:55:18Z","title":"Provably Robust DPO: Aligning Language Models with Noisy Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00409","snapshot_observed_at":"2026-08-16T04:18:40.034871Z","title":"Provably robust dpo: Aligning language models with noisy feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.034871Z"},"links":{"cited_paper":"/paper/2403.00409","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:5dc1d778a934a8a0fc9bef49cdc8c764f20a74dabd43c04013550c3bec7cf0c8","observation_id":"b9675d9a-123f-4c1c-b829-6b7d8892609d","resolution":{"observed_at":"2026-08-16T04:18:40.034871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.092021Z","title":"Deep reinforcement learning from human preferences","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.092021Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:a3157f8206bfc138dfb5fe290eee1893ee8542628a64352093aa5c0679885ecb","observation_id":"4b214a57-c63a-44cc-a86f-fc50abdf03cc","resolution":{"observed_at":"2026-08-16T04:18:40.092021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18101","last_updated":"2025-05-22T17:50:19Z","snapshot_observed_at":"2026-08-16T17:35:20.496227Z","submitted_at":"2025-01-30T02:47:41Z","title":"Diverse Preference Optimization","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18101","snapshot_observed_at":"2026-08-16T04:18:40.097323Z","title":"Diverse preference optimization.arXiv preprint arXiv:2501.18101, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.097323Z"},"links":{"cited_paper":"/paper/2501.18101","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:d0097da4d470e2a56a91c95193efaaab9905295f311d05523ca60af0d7889f62","observation_id":"99edc449-12fa-4e1d-9084-e2a3c0e2577d","resolution":{"observed_at":"2026-08-16T04:18:40.097323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.791000Z","title":"2D-DPO: Scaling direct preference optimization with 2-dimensional supervision","venue":null,"work_id":"a53a4d6a-ceb7-40df-ac98-5e77cd1ddbe2","year":2025},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.132613Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:2dc7d69ec8f33e6ecaf701c20dce50352f3a7d073f4cb9f6525f6d164a6cd960","observation_id":"46ec5300-70a3-4c60-a8f9-a7f7f07df7b7","resolution":{"observed_at":"2026-08-16T04:18:40.795844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11701","last_updated":"2025-03-12T08:45:15Z","snapshot_observed_at":"2026-08-16T12:50:50.237557Z","submitted_at":"2025-03-12T08:45:15Z","title":"A Survey of Direct Preference Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11701","snapshot_observed_at":"2026-08-16T04:18:40.171743Z","title":"A survey of direct preference optimization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.171743Z"},"links":{"cited_paper":"/paper/2503.11701","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:457c65c265cfd073b7b06bf594a8579410ad2f90639d5fef44aec9b1f08ac187","observation_id":"b99ca145-d560-4b7b-9ab4-46d5e33770e3","resolution":{"observed_at":"2026-08-16T04:18:40.171743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.05374","snapshot_observed_at":"2026-08-16T04:18:40.205387Z","title":"Trustworthy llms: a survey and guideline for evaluating large language models’ alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.205387Z"},"links":{"cited_paper":"/paper/2308.05374","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:8542ca01064ea7478d3aefba253f8c44fe9ad37ae5f869c6d2030e2ee53a490a","observation_id":"5d16bf50-25f6-4d67-9b7f-da58c07bff7c","resolution":{"observed_at":"2026-08-16T04:18:40.205387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00254","last_updated":"2024-05-27T14:08:40Z","snapshot_observed_at":"2026-08-16T13:56:25.795152Z","submitted_at":"2024-04-30T23:57:23Z","title":"RLHF from Heterogeneous Feedback via Personalization and Preference Aggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00254","snapshot_observed_at":"2026-08-16T04:18:40.210266Z","title":"Rlhf from heterogeneous feedback via personalization and preference aggregation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.210266Z"},"links":{"cited_paper":"/paper/2405.00254","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:2668fe4607a9f3cb0be5765832004a59c39a2fd2e2a8fbf260b3dcd4324c574e","observation_id":"1341ab5e-4e74-41a3-b22a-a327ab782103","resolution":{"observed_at":"2026-08-16T04:18:40.210266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.215067Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.215067Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:699a2f6dba7c5ed1f4d8a68d823a45f404d954ca8167e880b6a01492782a53df","observation_id":"3fd6d03a-72fb-401b-ac24-a6ebaf2a3947","resolution":{"observed_at":"2026-08-16T04:18:40.215067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-16T04:18:40.224347Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.224347Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:f3f7233839b191ca43a5d377ae2efed50c880b241239a3ebd5e536fbb733e33f","observation_id":"57710674-310b-406e-a080-2ada650490c2","resolution":{"observed_at":"2026-08-16T04:18:40.224347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15025","last_updated":"2023-09-26T15:49:23Z","snapshot_observed_at":"2026-08-16T14:57:28.373576Z","submitted_at":"2023-09-26T15:49:23Z","title":"Large Language Model Alignment: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15025","snapshot_observed_at":"2026-08-16T04:18:40.269907Z","title":"Large language model alignment: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.269907Z"},"links":{"cited_paper":"/paper/2309.15025","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:e962c5f9625e4678c932a03a101bd258302ba30878c6e1d71b3674609eeb737f","observation_id":"9953d08a-c9b7-499c-bc11-e479704e9215","resolution":{"observed_at":"2026-08-16T04:18:40.269907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.770563Z","title":"Things we like: human preferences among similar organisms and implications for conservation","venue":null,"work_id":"bfe2c31f-a1ae-42f3-bba0-56da59f7fff7","year":2007},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.307558Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:b77fa811b794a11a3c76f71834b6345c13be3f3dd4a6c81910164111f327ee08","observation_id":"857476ab-f5b4-4fba-aeb0-c03eae9761fe","resolution":{"observed_at":"2026-08-16T04:18:40.775002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.12966","last_updated":"2023-07-24T17:44:58Z","snapshot_observed_at":"2026-08-16T15:13:42.128297Z","submitted_at":"2023-07-24T17:44:58Z","title":"Aligning Large Language Models with Human: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.12966","snapshot_observed_at":"2026-08-16T04:18:40.312439Z","title":"Aligning large language models with human: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.312439Z"},"links":{"cited_paper":"/paper/2307.12966","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:205c6eb01b6503af61cb8a7ce227c59d74cf8e74751fde5a521bb6a4657fc61c","observation_id":"7f60104e-3e48-426c-8b1a-31cc8ce16fdd","resolution":{"observed_at":"2026-08-16T04:18:40.312439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12088","last_updated":"2022-03-27T06:51:57Z","snapshot_observed_at":"2026-08-16T20:37:56.916414Z","submitted_at":"2021-10-22T22:42:11Z","title":"Learning with Noisy Labels Revisited: A Study Using Real-World Human Annotations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12088","snapshot_observed_at":"2026-08-16T04:18:40.317605Z","title":"Learning with noisy labels revisited: A study using real-world human annotations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.317605Z"},"links":{"cited_paper":"/paper/2110.12088","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:d241fff15649e6ee524b66bd73c2b465264b36b06971b35346d3d0e3e49382d0","observation_id":"793f0b0b-2aae-441e-a55c-c64bb7e2653a","resolution":{"observed_at":"2026-08-16T04:18:40.317605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11999","last_updated":"2024-08-30T03:39:57Z","snapshot_observed_at":"2026-08-16T17:34:11.389619Z","submitted_at":"2024-04-18T08:49:38Z","title":"Token-level Direct Preference Optimization","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11999","snapshot_observed_at":"2026-08-16T04:18:40.424127Z","title":"Token- level direct preference optimization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.424127Z"},"links":{"cited_paper":"/paper/2404.11999","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:5f1083883e9d5e860f89a2d89dc005b9e0f455d367c4e56c9ed90c4aa73e9fed","observation_id":"5cd4cba5-630c-4b7c-9577-6982d9e9e87a","resolution":{"observed_at":"2026-08-16T04:18:40.424127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:18:40.610558Z","title":"Beyond one-preference-for-all: Multi-objective direct preference optimization","venue":null,"work_id":"a09187ab-155c-40ef-8846-9180eef17b68","year":2023},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.427730Z"},"links":{"citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:0ecf205e023e69742030279eb9055c91dae630a11ab51a80809912b1f39a7ee5","observation_id":"af46cbf7-a3e4-4e51-8ea6-658b6ce5e590","resolution":{"observed_at":"2026-08-16T04:18:40.678798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-16T00:15:57.597094Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-16T04:18:40.431498Z","title":"chosen” and one “rejected","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:18:40.431498Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2505.01706"},"observation_digest":"sha256:ecc751a4e77c4990b9e2133d0a2a0091add87620d463ac637f504bada88d3643","observation_id":"05846fd4-7eb7-416d-b9ab-dea33d3e4f0f","resolution":{"observed_at":"2026-08-16T04:18:40.431498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.01706","last_updated":"2025-05-03T05:59:13Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-16T17:34:30.444979Z","submitted_at":"2025-05-03T05:59:13Z","title":"Inducing Robustness in a 2 Dimensional Direct Preference Optimization Paradigm"},"reference_resolution":{"displayed":20,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":20},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 20 of 20 outbound references and 0 inbound Pith citation observations for arXiv:2505.01706."}