{"as_of":"2026-08-09T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc551d943fa7e4e1c464f9de7ede5a81b274818903552a68b6cc9425f1cc71de","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T01:03:57.000001Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:40:06.225176Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2401.04056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-04T19:40:06.225176Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":"0fbd2c89-e34c-4f7a-8ce7-13ee84640206","year":2024},"citing_paper":{"arxiv_id":"2402.01306","last_updated":"2024-11-19T18:12:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-02T10:53:36Z","title":"KTO: Model Alignment as Prospect Theoretic Optimization","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T12:17:53.478052Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2402.01306"},"observation_digest":"sha256:b46ffb5ffaace1c9bbb31dd6b510fbca13e3a64731b58eef69192a0bce5bb5d4","observation_id":"e858087c-4f0c-4fdb-a226-b81725be73f4","resolution":{"observed_at":"2026-05-12T12:17:53.574466Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-09T01:03:57.000001Z","title":"S., and Agarwal, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.03723","last_updated":"2025-03-01T01:43:31Z","snapshot_observed_at":"2026-08-09T00:55:51.557969Z","submitted_at":"2025-02-06T02:26:47Z","title":"Speaking the Language of Teamwork: LLM-Guided Credit Assignment in Multi-Agent Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T01:03:57.000001Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2502.03723"},"observation_digest":"sha256:c85513aadbdcfd18eb5cd6cc1a03b1fb4bc2d2a4f8f1782be6c0926ff53825bf","observation_id":"07a7d512-4dd4-49e0-a511-8fea0fc40018","resolution":{"observed_at":"2026-08-09T01:03:57.000001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-08T19:40:42.044924Z","title":"S., and Agarwal, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06861","last_updated":"2025-02-08T00:01:37Z","snapshot_observed_at":"2026-08-08T19:30:36.087038Z","submitted_at":"2025-02-08T00:01:37Z","title":"Design Considerations in Offline Preference-based RL","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-08T19:40:42.044924Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2502.06861"},"observation_digest":"sha256:537f9fc1b8f3ae2b4a40bdeddf25b408538c64e62c51dccb5d4af0d420e0853c","observation_id":"1daba942-17dd-4a26-bfe4-8731dcd449fd","resolution":{"observed_at":"2026-08-08T19:40:42.044924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T20:38:32.922229Z","title":"Swamy, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09780","last_updated":"2025-02-13T21:28:51Z","snapshot_observed_at":"2026-08-08T00:01:40.401427Z","submitted_at":"2025-02-13T21:28:51Z","title":"Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T20:38:32.922229Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2502.09780"},"observation_digest":"sha256:0844d8a3cae6d35d56836081852bacea50861d66b1472ad37003472c58c0f21c","observation_id":"ba2d89d1-1192-451c-b3d4-1c5f0e0aab1b","resolution":{"observed_at":"2026-08-07T20:38:32.922229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T13:45:01.173114Z","title":"S., and Agarwal, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21395","last_updated":"2025-05-27T16:23:24Z","snapshot_observed_at":"2026-08-07T13:26:21.678395Z","submitted_at":"2025-05-27T16:23:24Z","title":"Square$\\chi$PO: Differentially Private and Robust $\\chi^2$-Preference Optimization in Offline Direct Alignment","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T13:45:01.173114Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2505.21395"},"observation_digest":"sha256:2cd4582858ceccc5a8398ad0639ee7ccdb8cc46924c890007543b535066301ca","observation_id":"528e43c5-8c35-4cc0-81c2-71cccdb87003","resolution":{"observed_at":"2026-08-07T13:45:01.173114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T12:49:10.847272Z","title":"A minimaximalist approach to reinforcement learning from human feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23749","last_updated":"2025-05-29T17:59:20Z","snapshot_observed_at":"2026-08-07T12:36:14.760657Z","submitted_at":"2025-05-29T17:59:20Z","title":"Distortion of AI Alignment: Does Preference Optimization Optimize for Preferences?","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:49:10.847272Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2505.23749"},"observation_digest":"sha256:567f4e3f88069ec819be692207907342fd5c7c926df9a5490d81658e3075fe87","observation_id":"cd7f7b4b-28b6-43e8-b9aa-3ae3317ff2c8","resolution":{"observed_at":"2026-08-07T12:49:10.847272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-07T05:03:28.528670Z","title":"A minimax- imalist approach to reinforcement learning from human feedback.arXiv:2401.04056, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09026","last_updated":"2025-06-13T17:44:03Z","snapshot_observed_at":"2026-08-07T12:11:23.366278Z","submitted_at":"2025-06-10T17:52:42Z","title":"e3: Learning to Explore Enables Extrapolation of Test-Time Compute for LLMs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:28.528670Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2506.09026"},"observation_digest":"sha256:b8bd088d8e09be2a2b0392ec1dda3b0e95e7dce5c2a86afb005803fbdf212f5c","observation_id":"d722aab7-75a3-4e2c-b6c7-a7e5fb01397f","resolution":{"observed_at":"2026-08-07T05:03:28.528670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-06T17:53:19.732489Z","title":"URL https://arxiv.org/abs/2401.04056, 2401.04056","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.10621","last_updated":"2025-07-14T00:49:44Z","snapshot_observed_at":"2026-08-06T17:43:39.303559Z","submitted_at":"2025-07-14T00:49:44Z","title":"Game Theory Meets LLM and Agentic AI: Reimagining Cybersecurity for the Age of Intelligent Threats","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T17:53:19.732489Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2507.10621"},"observation_digest":"sha256:3dbcdff6ee23baef7e2ca0750435869a68745808732c40bdd3546503649da66e","observation_id":"16a5bab6-50fb-4ee9-8ab7-5debbd946e2c","resolution":{"observed_at":"2026-08-06T17:53:19.732489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-04T16:07:40.529374Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.16679","last_updated":"2025-09-20T13:11:28Z","snapshot_observed_at":"2026-08-04T16:07:24.699834Z","submitted_at":"2025-09-20T13:11:28Z","title":"Reinforcement Learning Meets Large Language Models: A Survey of Advancements and Applications Across the LLM Lifecycle","version":1},"reference_index":157,"source":"pdf_text","source_observed_at":"2026-08-04T16:07:40.529374Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2509.16679"},"observation_digest":"sha256:c526910cac5398a14296065e5e2f2e019d7073a25c45e00bfbd8980df3304964","observation_id":"bc2264f5-4b18-4e15-8750-cca5d7658c02","resolution":{"observed_at":"2026-08-04T16:07:40.529374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-03T06:06:23.941662Z","title":"A minimaxi- malist approach to reinforcement learning from human feedback.arXiv preprint arXiv:2401.04056,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.02572","last_updated":"2026-06-07T17:10:20Z","snapshot_observed_at":"2026-08-05T00:08:42.424141Z","submitted_at":"2026-01-31T05:45:51Z","title":"Reward Shaping for (Inference-Time) Alignment: A Stackelberg Game Perspective","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T06:06:23.941662Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2602.02572"},"observation_digest":"sha256:b976e48cb4571b6c59c1d4b05014c86b16c83b46a924a5ee0ba33e81c8b921dc","observation_id":"ee96b49f-3cc8-47e0-9d31-f77649e93a17","resolution":{"observed_at":"2026-08-03T06:06:23.941662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2401.04056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-04T19:40:06.225176Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":"0fbd2c89-e34c-4f7a-8ce7-13ee84640206","year":2024},"citing_paper":{"arxiv_id":"2605.06992","last_updated":"2026-05-07T22:16:03Z","snapshot_observed_at":"2026-07-06T23:19:25.538514Z","submitted_at":"2026-05-07T22:16:03Z","title":"Why Does Agentic Safety Fail to Generalize Across Tasks?","version":1},"reference_index":103,"source":"pdf_text","source_observed_at":"2026-05-11T01:55:38.554161Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2605.06992"},"observation_digest":"sha256:1eca734ff5a04a3e2de9ad7f1c34bc0910fb97bfb03389fc8c587d57318046a2","observation_id":"b11854d4-cec3-48d3-a19b-07aaa8f37f4c","resolution":{"observed_at":"2026-05-11T04:06:00.273725Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2401.04056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-04T19:40:06.225176Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":"0fbd2c89-e34c-4f7a-8ce7-13ee84640206","year":2024},"citing_paper":{"arxiv_id":"2605.09922","last_updated":"2026-05-11T03:17:31Z","snapshot_observed_at":"2026-08-04T13:55:41.915999Z","submitted_at":"2026-05-11T03:17:31Z","title":"Team-Based Self-Play With Dual Adaptive Weighting for Fine-Tuning LLMs","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-12T04:56:01.953853Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2605.09922"},"observation_digest":"sha256:cfe1fd130240af2a34c81d8d30ab7e2e85e4aaeace6125b61bbb06ab87092ed0","observation_id":"98ceb732-b196-4dd3-a71f-c97c274c37f3","resolution":{"observed_at":"2026-05-12T05:46:31.191814Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2401.04056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-04T19:40:06.225176Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":"0fbd2c89-e34c-4f7a-8ce7-13ee84640206","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":1},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-13T04:55:55.013900Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:5403756317c6bdb8723dfef1e19c8e90b39d241a829f7dbe1122779203100008","observation_id":"43f040d0-a16a-423f-9405-13456cb68b72","resolution":{"observed_at":"2026-05-13T04:57:17.360108Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2401.04056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-04T19:40:06.225176Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":"0fbd2c89-e34c-4f7a-8ce7-13ee84640206","year":2024},"citing_paper":{"arxiv_id":"2605.12288","last_updated":"2026-06-10T07:32:21Z","snapshot_observed_at":"2026-07-06T23:23:59.123377Z","submitted_at":"2026-05-12T15:44:33Z","title":"TokenRatio: Principled Token-Level Preference Optimization via Ratio Matching","version":2},"reference_index":155,"source":"arxiv_source","source_observed_at":"2026-05-15T05:41:10.714594Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2605.12288"},"observation_digest":"sha256:b8a489b0027d3082bce43dcb54f5254401766037d2e510bf3f7830107d11561b","observation_id":"055acd68-30f0-470a-b6b4-38d503007950","resolution":{"observed_at":"2026-05-15T05:45:06.540244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":"2401.04056","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-04T19:40:06.225176Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":"0fbd2c89-e34c-4f7a-8ce7-13ee84640206","year":2024},"citing_paper":{"arxiv_id":"2606.25398","last_updated":"2026-06-24T04:52:04Z","snapshot_observed_at":"2026-08-06T04:56:00.009279Z","submitted_at":"2026-06-24T04:52:04Z","title":"MAPL: Multi-Objective Preference Learning for Robot Locomotion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-25T21:11:00.753949Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2606.25398"},"observation_digest":"sha256:abb24700d3f1c2188256e07e59904284551ecaa13cf526ad6793726e777b6326","observation_id":"0789e877-01c2-4fa2-9f50-2a28bbbd37dc","resolution":{"observed_at":"2026-07-04T19:40:06.226832Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:0835c0e5209fc91ecb15e44542d3177568efc5b9a9ad55030e7a0a736b4b5a06","observation_id":"d35339d3-9b4b-4251-a48b-9d7aa3a6ede3","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-02T08:40:54.387397Z","title":"arXiv preprint arXiv:2401.04056 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":188,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:54.387397Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:147b15a1a8d1ad7e21235049328b7402ec298b465695b939e1c5cb6f04a50c91","observation_id":"a5a3a907-f792-423e-8385-c14807685fc2","resolution":{"observed_at":"2026-08-02T08:40:54.387397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04056","snapshot_observed_at":"2026-08-01T13:10:37.604919Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.22716","last_updated":"2026-07-21T15:52:30Z","snapshot_observed_at":"2026-08-06T12:10:57.542923Z","submitted_at":"2026-07-21T15:52:30Z","title":"Visual Token Compression Enhances Robustness of MLLMs","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-01T13:10:37.604919Z"},"links":{"cited_paper":"/paper/2401.04056","citing_paper":"/paper/2607.22716"},"observation_digest":"sha256:c6f545ad44321a2bf301b1c73a00b692aad01e0f2e93e57153357d8d87ef9ac7","observation_id":"28d11439-d28d-4cf4-9178-6e6ffaba6eb9","resolution":{"observed_at":"2026-08-01T13:10:37.604919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2401.04056/citation-record","integrity":"/paper/2401.04056/integrity","json":"/paper/2401.04056/citation-record.json","paper":"/paper/2401.04056"},"outbound":[],"paper":{"arxiv_id":"2401.04056","last_updated":"2024-06-13T14:45:36Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T17:12:56.275051Z","submitted_at":"2024-01-08T17:55:02Z","title":"A Minimaximalist Approach to Reinforcement Learning from Human Feedback"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 18 inbound Pith citation observations for arXiv:2401.04056."}