{"as_of":"2026-08-08T12:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1082d55b8f0660c645c1693c11ebe1d088435e2b32f1335ffc85179e7e7f07e2","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T19:20:13.002840Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T23:29:02.979336Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T19:20:13.002840Z","title":"D., and Sun, W","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.10158","last_updated":"2025-06-05T01:30:34Z","snapshot_observed_at":"2026-08-07T19:07:44.285423Z","submitted_at":"2025-02-14T13:37:02Z","title":"Combinatorial Reinforcement Learning with Preference Feedback","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T19:20:13.002840Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2502.10158"},"observation_digest":"sha256:9bfdb4abd31abb13df45ac36b625322ac6bbf9654fc3ea5b553dc645b7c3f6dd","observation_id":"ba8ba420-fd18-4f34-b324-9b965813f310","resolution":{"observed_at":"2026-08-07T19:20:13.002840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T15:19:09.500623Z","title":"D., and Sun, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15694","last_updated":"2025-05-21T16:07:47Z","snapshot_observed_at":"2026-08-08T05:51:01.468645Z","submitted_at":"2025-05-21T16:07:47Z","title":"A Unified Theoretical Analysis of Private and Robust Offline Alignment: from RLHF to DPO","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:19:09.500623Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2505.15694"},"observation_digest":"sha256:049c442cafbdb92b71d99256ccc51cd9d09241431a256cdce17cad4590dbea0a","observation_id":"4c1e7082-13de-40a7-a7a9-ffe05b95f5db","resolution":{"observed_at":"2026-08-07T15:19:09.500623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T14:10:43.538251Z","title":"Provable offline preference-based reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20268","last_updated":"2025-07-24T14:21:12Z","snapshot_observed_at":"2026-08-07T13:53:33.149103Z","submitted_at":"2025-05-26T17:44:08Z","title":"Outcome-Based Online Reinforcement Learning: Algorithms and Fundamental Limits","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T14:10:43.538251Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2505.20268"},"observation_digest":"sha256:36106f370d65305f0db5a628f8b3e01884f723071b9a61509b318543389823cc","observation_id":"16c687fe-e2a0-4cef-b0f2-4cef349d565e","resolution":{"observed_at":"2026-08-07T14:10:43.538251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T14:01:06.936809Z","title":"Provable offline preference-based reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20556","last_updated":"2025-05-26T22:34:42Z","snapshot_observed_at":"2026-08-07T13:49:33.928724Z","submitted_at":"2025-05-26T22:34:42Z","title":"Learning a Pessimistic Reward Model in RLHF","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:01:06.936809Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2505.20556"},"observation_digest":"sha256:da7a6e33abb627f9fb50d16c5dbfcbea30d73a098b538a87593a3eb907498430","observation_id":"a3074639-539a-49a7-97b8-496c5ef4f467","resolution":{"observed_at":"2026-08-07T14:01:06.936809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-07T12:43:50.030374Z","title":"Lee, and Wen Sun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23927","last_updated":"2025-05-29T18:22:02Z","snapshot_observed_at":"2026-08-07T12:35:50.981783Z","submitted_at":"2025-05-29T18:22:02Z","title":"Thompson Sampling in Online RLHF with General Function Approximation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:43:50.030374Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2505.23927"},"observation_digest":"sha256:a0d3a38833e48ddf130e6d3253622c990e6b7201f48c39c80f22d1152aac8652","observation_id":"be121500-6594-443b-9b65-15b395ac386f","resolution":{"observed_at":"2026-08-07T12:43:50.030374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-06T19:28:59.418783Z","title":"Provable offline preference-based reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.05913","last_updated":"2025-07-08T11:59:48Z","snapshot_observed_at":"2026-08-08T02:07:55.656295Z","submitted_at":"2025-07-08T11:59:48Z","title":"Best-of-N through the Smoothing Lens: KL Divergence and Regret Analysis","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-06T19:28:59.418783Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2507.05913"},"observation_digest":"sha256:8f1e23b73fec092a27745c5541e8f6c27f86b3aaa7810e194abe21cc907a30b1","observation_id":"faa4c54d-4083-4620-95f4-cb0d669efcad","resolution":{"observed_at":"2026-08-06T19:28:59.418783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-03T14:03:36.586968Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2512.21917","last_updated":"2026-06-03T15:13:15Z","snapshot_observed_at":"2026-08-07T03:47:47.592130Z","submitted_at":"2025-12-26T08:22:41Z","title":"Semiparametric Preference Optimization: Your Language Model is Secretly a Single-Index Model","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T14:03:36.586968Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2512.21917"},"observation_digest":"sha256:fadbb46c918eeb2bab6e4c6d62965f166002da44a29ef37256d615d2c6086538","observation_id":"73973510-7d79-4868-92e3-2ab89a0ef4cb","resolution":{"observed_at":"2026-08-03T14:03:36.586968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T06:35:30.479542Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:11ab8209fffe8eccfc98e1c569e14365c66a5dc6de1b504b9f77175c07eb0bd9","observation_id":"0c8d5c55-211b-4cc2-88ee-685fe1b9f111","resolution":{"observed_at":"2026-05-16T06:37:28.562069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2602.06239","last_updated":"2026-05-15T16:18:46Z","snapshot_observed_at":"2026-07-06T22:44:46.690576Z","submitted_at":"2026-02-05T22:31:07Z","title":"Provably avoiding over-optimization in Direct Preference Optimization without knowing the data distribution","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-21T13:06:54.002248Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2602.06239"},"observation_digest":"sha256:bec7438e19396932a66d62e0b5a28c648de16d9c6eb607e27cd5df89d1b08daf","observation_id":"072c8af7-3370-41b3-a0c1-ca10dfdcd607","resolution":{"observed_at":"2026-05-21T13:10:10.495290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2603.28281","last_updated":"2026-04-09T09:10:22Z","snapshot_observed_at":"2026-07-06T22:51:05.074191Z","submitted_at":"2026-03-30T11:03:36Z","title":"Corruption-robust Offline Multi-agent Reinforcement Learning From Human Feedback","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-14T21:03:48.813600Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2603.28281"},"observation_digest":"sha256:c3158ca75f30e1abbacf1393d6ce9871fe693c92c80c6592b31a3c6fdb756655","observation_id":"efb1a5a2-635e-408b-865b-236fb3a78783","resolution":{"observed_at":"2026-05-14T21:19:29.063328Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2604.02349","last_updated":"2026-02-19T02:11:01Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-02-19T02:11:01Z","title":"OPRIDE: Offline Preference-based Reinforcement Learning via In-Dataset Exploration","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-15T21:38:53.792221Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2604.02349"},"observation_digest":"sha256:4276d4290870af38ce354032ffeecef3e53d0d0f7375478c0ade22b72e5f643d","observation_id":"cf716446-1873-4fa2-9096-1d4cc83eddd8","resolution":{"observed_at":"2026-05-15T21:40:20.967674Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2604.19024","last_updated":"2026-04-21T03:20:07Z","snapshot_observed_at":"2026-08-03T00:03:53.934930Z","submitted_at":"2026-04-21T03:20:07Z","title":"Policy Gradient Primal-Dual Method for Safe Reinforcement Learning from Human Feedback","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T02:23:20.208976Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2604.19024"},"observation_digest":"sha256:d29c72e85bef519d6f31898f369ed1efe97f6c03f389f4c1db0e6a2925850762","observation_id":"ad244cf2-7e9a-4b06-b231-43d295016ddc","resolution":{"observed_at":"2026-05-11T13:06:03.890094Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2605.09214","last_updated":"2026-05-09T23:17:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-09T23:17:46Z","title":"Fast Rates for Offline Contextual Bandits with Forward-KL Regularization under Single-Policy Concentrability","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T03:47:14.379908Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2605.09214"},"observation_digest":"sha256:75e93cc19b0e0c2ad9c22d851923efadb9cefbdb47d0b6b6554419082f050bfc","observation_id":"f8da3cfa-a9c5-4e30-8936-b6b158725598","resolution":{"observed_at":"2026-05-12T06:56:31.090069Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2305.14816","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-03T23:29:02.979336Z","title":"Provable offline preference-based reinforcement learning.arXiv preprint arXiv:2305.14816","venue":null,"work_id":"74b1c533-fe41-4aa2-85a8-94ba5ac03f58","year":2023},"citing_paper":{"arxiv_id":"2606.18531","last_updated":"2026-06-16T22:55:45Z","snapshot_observed_at":"2026-08-04T10:57:17.249083Z","submitted_at":"2026-06-16T22:55:45Z","title":"When Does Trajectory-Level Supervision Permit Efficient Offline Reinforcement Learning?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-26T22:06:24.412259Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2606.18531"},"observation_digest":"sha256:62faf77fa4e065eed4fdb54cd2012d951628691635b13a15248dbef4712ab83c","observation_id":"a6624355-e3cf-4a8d-ae53-9721c458c5cb","resolution":{"observed_at":"2026-07-03T23:29:02.980864Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-07-11T13:53:36.775836Z","title":"arXiv preprint arXiv:2305.14816 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":1},"reference_index":228,"source":"arxiv_source","source_observed_at":"2026-07-11T13:53:36.775836Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:bc13c072151dbe4ae61d180695d1f681ae36a1e87bed148d8b10f1cd15299e66","observation_id":"4f46e08b-8347-4ca8-8c67-e650cc688904","resolution":{"observed_at":"2026-07-11T13:53:36.775836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14816","snapshot_observed_at":"2026-08-02T08:40:58.612845Z","title":"arXiv preprint arXiv:2305.14816 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04763","last_updated":"2026-07-26T14:17:18Z","snapshot_observed_at":"2026-08-02T10:24:43.977557Z","submitted_at":"2026-07-06T07:56:53Z","title":"Multi-Turn On-Policy Distillation with Prefix Replay","version":3},"reference_index":229,"source":"arxiv_source","source_observed_at":"2026-08-02T08:40:58.612845Z"},"links":{"cited_paper":"/paper/2305.14816","citing_paper":"/paper/2607.04763"},"observation_digest":"sha256:71f1b3cdc9490c6f48388da16e31e1e92e56e689d806991ee7fd91d73ef20a8a","observation_id":"454061c9-42bb-493b-b17a-5224417792c2","resolution":{"observed_at":"2026-08-02T08:40:58.612845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2305.14816/citation-record","integrity":"/paper/2305.14816/integrity","json":"/paper/2305.14816/citation-record.json","paper":"/paper/2305.14816"},"outbound":[],"paper":{"arxiv_id":"2305.14816","last_updated":"2023-09-29T19:18:55Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T15:32:18.583350Z","submitted_at":"2023-05-24T07:11:26Z","title":"Provable Offline Preference-Based Reinforcement Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2305.14816."}