{"as_of":"2026-08-07T23:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6dcb2aafabdbfa89b4d0a8fa1422c896725498234b5bc695a1c7a2a4eabaa3b","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":19,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":19,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:15:46.346809Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T15:15:46.346809Z","title":"Maxmin-rlhf: Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17122","last_updated":"2025-05-21T17:59:02Z","snapshot_observed_at":"2026-08-07T15:09:00.509238Z","submitted_at":"2025-05-21T17:59:02Z","title":"Shallow Preference Signals: Large Language Model Aligns Even Better with Truncated Data?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:15:46.346809Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.17122"},"observation_digest":"sha256:ef8882939aec99e79041f5ad15d975995df87b612e0ee94254f4ec33f383a0ab","observation_id":"096646df-cbfe-410b-b49b-a168e2289500","resolution":{"observed_at":"2026-08-07T15:15:46.346809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T14:52:55.785963Z","title":"MaxMin -RLHF: Alignment with Diverse Human Preferences,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.17380","last_updated":"2025-05-23T01:33:04Z","snapshot_observed_at":"2026-08-07T16:44:15.548648Z","submitted_at":"2025-05-23T01:33:04Z","title":"AI-Augmented LLMs Achieve Therapist-Level Responses in Motivational Interviewing","version":1},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-08-07T14:52:55.785963Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.17380"},"observation_digest":"sha256:3e4a505ab1d1e8a66627a70c7a779f89cae4c5dbf64eb024c4de92e3aff2ebb3","observation_id":"ce76eea6-79d0-441b-acdb-e17c7eb94076","resolution":{"observed_at":"2026-08-07T14:52:55.785963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T14:16:32.906989Z","title":"Maxmin-rlhf: Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19501","last_updated":"2025-06-02T21:31:08Z","snapshot_observed_at":"2026-08-07T22:56:52.068434Z","submitted_at":"2025-05-26T04:28:46Z","title":"Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:32.906989Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.19501"},"observation_digest":"sha256:eb99b7d60233a0af4cce1c541171e3f88c3108534732b245fefada5696989434","observation_id":"e4b22f4d-898f-4f46-9fba-5bcad3ffbc6f","resolution":{"observed_at":"2026-08-07T14:16:32.906989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T14:16:37.813949Z","title":"Chakraborty, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20627","last_updated":"2025-05-27T02:07:35Z","snapshot_observed_at":"2026-08-07T13:48:08.093334Z","submitted_at":"2025-05-27T02:07:35Z","title":"Fundamental Limits of Game-Theoretic LLM Alignment: Smith Consistency and Preference Matching","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:16:37.813949Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.20627"},"observation_digest":"sha256:20493f23febdd4a0254416ac1306091988f18562052edccab14028706a6037e3","observation_id":"a5faf15b-93b8-4fd3-ae42-d75431351b0a","resolution":{"observed_at":"2026-08-07T14:16:37.813949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T12:49:05.774124Z","title":"Maxmin- RLHF : Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:05.774124Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:c786249c0dc465db58f37b710f7f9568a550d13f9e965b78f8b717adad708aaf","observation_id":"ceee655c-706a-4bed-9b54-bddb236a2c17","resolution":{"observed_at":"2026-08-07T12:49:05.774124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-07T01:04:30.349050Z","title":"URLhttps://openreview.net/forum?id=bx24KpJ4Eb","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.12350","last_updated":"2025-06-14T05:14:49Z","snapshot_observed_at":"2026-08-07T00:49:43.707111Z","submitted_at":"2025-06-14T05:14:49Z","title":"Theoretical Tensions in RLHF: Reconciling Empirical Success with Inconsistencies in Social Choice Theory","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T01:04:30.349050Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2506.12350"},"observation_digest":"sha256:e5344592239941473decc370e696e7239fac61ee5d9d1be6bf951abcfff30f94","observation_id":"074dd878-1664-4c9d-88dc-fa80b3d653da","resolution":{"observed_at":"2026-08-07T01:04:30.349050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-06T16:34:24.955343Z","title":"Maxmin-rlhf: Alignment with diverse human preferences","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:24.955343Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:89cd682d595bde3e04e6121b63586263f0d5a8abfbd5b9a63c082c04ae85d960","observation_id":"e120f7f4-43cc-4699-8c0a-44fc1c404824","resolution":{"observed_at":"2026-08-06T16:34:24.955343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T10:54:11.144244Z","title":"Maxmin- RLHF : Alignment with diverse human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.03672","last_updated":"2025-09-03T19:42:50Z","snapshot_observed_at":"2026-08-05T10:54:05.383948Z","submitted_at":"2025-09-03T19:42:50Z","title":"SharedRep-RLHF: A Shared Representation Approach to RLHF with Diverse Preferences","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T10:54:11.144244Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2509.03672"},"observation_digest":"sha256:e9d1685108159e183c78d3c8b4d6381d85d1f71e0aece83710385fe566bfb2d7","observation_id":"1fb46bd4-3130-4a4c-8d0c-9357b37ad186","resolution":{"observed_at":"2026-08-05T10:54:11.144244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2603.27141","last_updated":"2026-03-28T05:33:42Z","snapshot_observed_at":"2026-07-06T22:50:55.897076Z","submitted_at":"2026-03-28T05:33:42Z","title":"Routing Sensitivity Without Controllability: A Diagnostic Study of Fairness in MoE Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-14T23:06:53.369244Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2603.27141"},"observation_digest":"sha256:24af1a00271a79eb7252bf8d4c1ff82194d94a879fcb3fd2b97b757f01b2183f","observation_id":"4587229b-30a2-4f7f-bbc2-331ef119362b","resolution":{"observed_at":"2026-05-14T23:08:14.502735Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-07-13T10:27:28.560210Z","title":"Maxmin-rlhf: Alignment with diverse human preferences.arXiv preprint arXiv:2402.08925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.04258","last_updated":"2026-04-05T20:30:44Z","snapshot_observed_at":"2026-07-13T10:27:28.305671Z","submitted_at":"2026-04-05T20:30:44Z","title":"Context Engineering: A Practitioner Methodology for Structured Human-AI Collaboration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T10:27:28.560210Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2604.04258"},"observation_digest":"sha256:69042c81fad749b21dc90ac54ce5d9b62058d1829d534076968a9b9b34b10f72","observation_id":"d32f6137-2840-45a6-baa6-75fd3da89908","resolution":{"observed_at":"2026-07-13T10:27:28.560210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2604.25895","last_updated":"2026-04-28T17:39:14Z","snapshot_observed_at":"2026-07-06T23:11:39.318906Z","submitted_at":"2026-04-28T17:39:14Z","title":"Three Models of RLHF Annotation: Extension, Evidence, and Authority","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-07T14:28:31.451466Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2604.25895"},"observation_digest":"sha256:aaa07afddb7193f0113ddf89df484bb038d62fad8a353c2f449c2c3c889f213e","observation_id":"611edaa1-0145-4bd2-9645-e1a3494810c1","resolution":{"observed_at":"2026-05-12T00:46:12.376743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:5de439593e05dd3c5e502fda78003e1c98a5bd55795f44f81897046adbcb5258","observation_id":"e820d6a1-ae8a-4936-8432-c780f7c99abe","resolution":{"observed_at":"2026-05-13T04:57:17.363434Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:8d5f2f6e43a66adda88db347ffb81f46be78b81cfdb379e130f8f85d413f9971","observation_id":"897c0801-edca-4526-891b-9f9aab4e11b2","resolution":{"observed_at":"2026-05-15T05:45:06.687669Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2605.13875","last_updated":"2026-05-08T06:56:35Z","snapshot_observed_at":"2026-08-02T22:27:33.584660Z","submitted_at":"2026-05-08T06:56:35Z","title":"Common-agency Games for Multi-Objective Test-Time Alignment","version":1},"reference_index":186,"source":"arxiv_source","source_observed_at":"2026-05-15T06:14:53.685486Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2605.13875"},"observation_digest":"sha256:451f8f6622d8a4041673987f9f89d828c93948c07af5dd334f15324670d19e93","observation_id":"67124bfd-3103-4e17-bac8-cb7791b09bc8","resolution":{"observed_at":"2026-05-15T06:15:06.670446Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2605.20408","last_updated":"2026-05-19T19:04:47Z","snapshot_observed_at":"2026-07-06T23:30:58.549353Z","submitted_at":"2026-05-19T19:04:47Z","title":"Spectral Souping: A Unified Framework for Online Preference Alignment","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T07:54:56.356555Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2605.20408"},"observation_digest":"sha256:5723d9044ef788778889994f3e32e5815b169144daae75aa4847a6e9d4bc5253","observation_id":"3ffe8c78-39bb-4d15-8aff-ac38ad70fead","resolution":{"observed_at":"2026-05-21T07:59:50.933384Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2605.30323","last_updated":"2026-05-28T17:56:54Z","snapshot_observed_at":"2026-08-01T08:56:52.622755Z","submitted_at":"2026-05-28T17:56:54Z","title":"In-Context Reward Adaptation for Robust Preference Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:19:55.177440Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2605.30323"},"observation_digest":"sha256:c1f1834b40219d878b7c8b5622195f27d12705236fb3f26594db34c850a35275","observation_id":"2a008025-17e7-46c0-92e4-3797e5b5484b","resolution":{"observed_at":"2026-06-29T08:23:15.199143Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-07-13T17:56:39.720418Z","title":"Chen, Z., et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00005","last_updated":"2026-03-26T20:38:21Z","snapshot_observed_at":"2026-08-05T00:30:59.637532Z","submitted_at":"2026-03-26T20:38:21Z","title":"Emergent Collaborative Deliberation in Multi-Model AI Systems: A BFT-Derived Protocol for Epistemic Synthesis","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T17:56:39.720418Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2606.00005"},"observation_digest":"sha256:622a1b5ca2b08bd2793415b327640de940dc242f1bd3f75b515faf5c126e2279","observation_id":"a2ccfd2b-6502-4400-9d0a-2d42449f3549","resolution":{"observed_at":"2026-07-13T17:56:39.720418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2606.09038","last_updated":"2026-06-08T05:10:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-08T05:10:05Z","title":"Personalization Meets Safety:Mechanisms,Risks,and Mitigations in Personalized LLMs","version":1},"reference_index":170,"source":"pdf_text","source_observed_at":"2026-06-27T16:49:14.243931Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2606.09038"},"observation_digest":"sha256:8fbd4f0f633e9fe5256fb7714293dfcc5fe43c01127c8a96965575d87eb52bc2","observation_id":"159df242-8eb4-4c45-9569-a202f71cc470","resolution":{"observed_at":"2026-06-27T16:51:06.023631Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences","version":2},"cited_work":{"arxiv_id":"2402.08925","doi":"10.48550/arxiv.2402.08925","metadata_source":"arxiv_reference","pith_arxiv_id":"2402.08925","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chakraborty, J","venue":"arXiv (Cornell University)","work_id":"822cb8b0-3cf0-4cf2-996c-ff7cbd541539","year":2024},"citing_paper":{"arxiv_id":"2606.10569","last_updated":"2026-06-09T08:32:11Z","snapshot_observed_at":"2026-08-07T16:41:18.046946Z","submitted_at":"2026-06-09T08:32:11Z","title":"Hidden Consensus:Preference-Validity Compression in Human Feedback","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-27T13:25:24.761133Z"},"links":{"cited_paper":"/paper/2402.08925","citing_paper":"/paper/2606.10569"},"observation_digest":"sha256:f84a7e022ddb1df2bfbe0224bbe4e48e14ae35f4b27bbdbf3ed6eee505d28dcd","observation_id":"33884791-2692-4c9a-9c63-1b500d432db3","resolution":{"observed_at":"2026-07-03T05:07:39.034042Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2402.08925/citation-record","integrity":"/paper/2402.08925/integrity","json":"/paper/2402.08925/citation-record.json","paper":"/paper/2402.08925"},"outbound":[],"paper":{"arxiv_id":"2402.08925","last_updated":"2024-12-26T00:15:20Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T17:29:51.807428Z","submitted_at":"2024-02-14T03:56:27Z","title":"MaxMin-RLHF: Alignment with Diverse Human Preferences"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 19 inbound Pith citation observations for arXiv:2402.08925."}