{"as_of":"2026-08-07T15:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ecb01f23fdba4bffbafd665b387fa4905a3d768ee9b07990e2b505542a747994","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:31:46.865446Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-28T19:32:35.329195Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":"2411.04991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-06-28T19:32:35.329195Z","title":"arXiv preprint arXiv:2411.04991 , year=","venue":null,"work_id":"4e780e32-22ca-4f50-a632-65b041b1995c","year":2024},"citing_paper":{"arxiv_id":"2502.06387","last_updated":"2026-04-07T06:33:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-10T12:15:27Z","title":"How Humans Help LLMs: Assessing and Incentivizing Human Preference Annotators","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-23T03:56:18.703995Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2502.06387"},"observation_digest":"sha256:4fa857f320ba2a2c35eb6ffbfff77d076aa131f7c79e79a7d88e6bf9133813f2","observation_id":"49292bd6-b8fe-4ec8-9aa2-a8a55676064d","resolution":{"observed_at":"2026-05-23T03:57:29.667863Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-07T14:31:46.865446Z","title":"Rethinking bradley-terry models in preference-based reward modeling: Foundations, theory, and alternatives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21537","last_updated":"2025-05-24T09:07:13Z","snapshot_observed_at":"2026-08-07T14:26:44.015259Z","submitted_at":"2025-05-24T09:07:13Z","title":"OpenReview Should be Protected and Leveraged as a Community Asset for Research in the Era of Large Language Models","version":1},"reference_index":137,"source":"arxiv_source","source_observed_at":"2026-08-07T14:31:46.865446Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2505.21537"},"observation_digest":"sha256:2c411d17b1e40b6f6effd109c6ce22d2721022a282150f1f46ad58f8485a762c","observation_id":"4dd5aed5-b748-4f5e-8d73-f93a350c6de0","resolution":{"observed_at":"2026-08-07T14:31:46.865446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-07T05:48:04.364900Z","title":"Hao Sun, Yunyi Shen, and Jean-Francois Ton","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07165","last_updated":"2025-06-08T14:31:06Z","snapshot_observed_at":"2026-08-07T05:38:06.929531Z","submitted_at":"2025-06-08T14:31:06Z","title":"AMoPO: Adaptive Multi-objective Preference Optimization without Reward Models and Reference Models","version":1},"reference_index":1027,"source":"pdf_text","source_observed_at":"2026-08-07T05:48:04.364900Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2506.07165"},"observation_digest":"sha256:eb4f28d722848c998d489a35a53657316c5c2e659dc208a408b8e8529e36e17b","observation_id":"a13a5ca8-7485-485b-9904-bfad94f57cc4","resolution":{"observed_at":"2026-08-07T05:48:04.364900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-06T16:34:25.213454Z","title":"Query-dependent prompt evaluation and optimization with offline inverse rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.13158","last_updated":"2025-07-17T14:22:24Z","snapshot_observed_at":"2026-08-07T07:16:46.127762Z","submitted_at":"2025-07-17T14:22:24Z","title":"Inverse Reinforcement Learning Meets Large Language Model Post-Training: Basics, Advances, and Opportunities","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-06T16:34:25.213454Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2507.13158"},"observation_digest":"sha256:5018949a37bc1f715130c256b01ddfeb3feeb0daaa18dc95ff1da7e0739e480b","observation_id":"1b8a5cf1-704d-4ee7-9611-ac9b10123401","resolution":{"observed_at":"2026-08-06T16:34:25.213454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-06T12:54:37.374599Z","title":"Rethink- ing bradley-terry models in preference-based reward mod- eling: Foundations, theory, and alternatives","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.21391","last_updated":"2025-07-30T04:49:38Z","snapshot_observed_at":"2026-08-06T15:49:24.780563Z","submitted_at":"2025-07-28T23:52:53Z","title":"Multimodal LLMs as Customized Reward Models for Text-to-Image Generation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T12:54:37.374599Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2507.21391"},"observation_digest":"sha256:20ce2bde27a57f2d27cbb6b39658e9f6bfdff35637489fff857be5e31b90c9a1","observation_id":"faaa401d-b7f0-4ec2-b1aa-a54f8cd4e031","resolution":{"observed_at":"2026-08-06T12:54:37.374599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":"2411.04991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-06-28T19:32:35.329195Z","title":"arXiv preprint arXiv:2411.04991 , year=","venue":null,"work_id":"4e780e32-22ca-4f50-a632-65b041b1995c","year":2024},"citing_paper":{"arxiv_id":"2605.07724","last_updated":"2026-06-03T12:55:17Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T13:27:23Z","title":"Curated Synthetic Data Doesn't Have to Collapse: A Theoretical Study of Generative Retraining with Pluralistic Preferences","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-11T02:30:14.693348Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2605.07724"},"observation_digest":"sha256:1698b0421cd90973faa5edd060b09fc5aeb7c5803c907ee14b56fe0470740d31","observation_id":"4e368313-1aaa-4300-b279-2afba233b418","resolution":{"observed_at":"2026-05-11T02:30:54.518269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":"2411.04991","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-06-28T19:32:35.329195Z","title":"arXiv preprint arXiv:2411.04991 , year=","venue":null,"work_id":"4e780e32-22ca-4f50-a632-65b041b1995c","year":2024},"citing_paper":{"arxiv_id":"2606.07629","last_updated":"2026-05-30T18:47:52Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-30T18:47:52Z","title":"Large Language Models Should Learn Personalized Rather Than Aggregated Human Preferences","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T19:03:47.751245Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2606.07629"},"observation_digest":"sha256:882450d8ede4b721a120ba0c5e760988ad60f482013889427eaaa46408081027","observation_id":"4cf75416-2bca-4a70-b028-30d595d534e8","resolution":{"observed_at":"2026-06-28T19:32:35.330785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04991","snapshot_observed_at":"2026-08-01T23:02:53.068235Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15552","last_updated":"2026-07-17T01:52:02Z","snapshot_observed_at":"2026-08-01T23:02:50.527732Z","submitted_at":"2026-07-17T01:52:02Z","title":"From Feasibility to Desirability: Plan, Learn, Adapt (PLA) Framework for Personalized On-Device Itinerary Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T23:02:53.068235Z"},"links":{"cited_paper":"/paper/2411.04991","citing_paper":"/paper/2607.15552"},"observation_digest":"sha256:1c5c0f3bfddce95867ccbda36f9797d7e576b523fe6e63e790c00bcf3c0f9b49","observation_id":"59dad6fc-750f-4375-a283-f13f9e6a4c58","resolution":{"observed_at":"2026-08-01T23:02:53.068235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.04991/citation-record","integrity":"/paper/2411.04991/integrity","json":"/paper/2411.04991/citation-record.json","paper":"/paper/2411.04991"},"outbound":[],"paper":{"arxiv_id":"2411.04991","last_updated":"2025-01-26T00:46:36Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T19:46:54.707852Z","submitted_at":"2024-11-07T18:57:03Z","title":"Rethinking Bradley-Terry Models in Preference-Based Reward Modeling: Foundations, Theory, and Alternatives"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2411.04991."}