{"as_of":"2026-08-23T11:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c2da2e2cbaafa6f03fdbcfdaff101ccea59c231674badba463cf3b80ef1bb09b","coverage":[{"denominator":25,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":25,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:16:41.636528Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.22401/citation-record","integrity":"/paper/2506.22401/integrity","json":"/paper/2506.22401/citation-record.json","paper":"/paper/2506.22401"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:42.323520Z","title":"A policy π : S 7→∆(A) specifies an action selection rule, where π(a|s) specifies the probability of taking action a in state s for each (s, a) ∈ S × A","venue":null,"work_id":"2cb4ca47-f68c-47e5-8952-5e7fb0766bef","year":2014},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.636528Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:78404f29234e2731f886ced0a8cf4f61567efd9630ac62343cdeba2dad324f21","observation_id":"04d6714c-a09f-401c-8705-c4a706c8fd77","resolution":{"observed_at":"2026-08-06T22:16:42.380764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:42.702577Z","title":"(40) Here, H(·) is the entropy function satisfying 0 ⩽ H(p) ⩽ log |A|, ∀p ∈ ∆(A)","venue":null,"work_id":"c3eb866b-c7fa-49dd-880b-93b80ec6d927","year":2017},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.516439Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:c8e651b465c8c1da4bad5cd81f5fe54e4c1e99828d9425573fb261785f661ba7","observation_id":"9dbf8921-89fd-426a-bcc4-b369363ac640","resolution":{"observed_at":"2026-08-06T22:16:42.753911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.05032","last_updated":"2019-12-10T22:31:09Z","snapshot_observed_at":"2026-08-13T01:38:14.385512Z","submitted_at":"2019-12-10T22:31:09Z","title":"Imitation Learning via Off-Policy Distribution Matching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.05032","snapshot_observed_at":"2026-08-06T22:16:40.577492Z","title":"Kostrikov, O","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.577492Z"},"links":{"cited_paper":"/paper/1912.05032","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:503dad92e25c5d44ba0de280adea784ae057d1dd0adb5f50bba840fe6d5179f5","observation_id":"7418e6c8-5dc5-4ab3-98e0-36583c608810","resolution":{"observed_at":"2026-08-06T22:16:40.577492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:42.461438Z","title":"Assumption 5 (Policy class)","venue":null,"work_id":"045b72d4-2436-4284-9280-5c307f0b7f0a","year":2022},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.589826Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:3bd00ede30286426faa482d3723d5041f02d20ae550e1efc718ebb0601cd51f7","observation_id":"25f56446-c572-4bca-9973-944118a22325","resolution":{"observed_at":"2026-08-06T22:16:42.508330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:16:40.863640Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.863640Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:f4ee5c45aea616779181ec2993cde2f6d1f298cb765e1e35d09db6f6548086c9","observation_id":"a90d7736-e7ad-4fdf-8ab1-90be08d0b6d5","resolution":{"observed_at":"2026-08-06T22:16:40.863640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-06T22:16:41.087989Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.087989Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:3b2707bf0e5029d62c1e8521900fe75f438cbc3e8baa240882bb12e191359720","observation_id":"eb877a13-5209-4cd4-9e20-482f5adfc989","resolution":{"observed_at":"2026-08-06T22:16:41.087989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.06100","last_updated":"2017-10-17T05:03:19Z","snapshot_observed_at":"2026-08-14T20:23:05.774912Z","submitted_at":"2017-10-17T05:03:19Z","title":"Primal-Dual $\\pi$ Learning: Sample Complexity and Sublinear Run Time for Ergodic Markov Decision Problems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.06100","snapshot_observed_at":"2026-08-06T22:16:41.136263Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.136263Z"},"links":{"cited_paper":"/paper/1710.06100","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:897e4f213725ad78bfe60a5e76bf45d0d4347ac62bd72932e01a3e89869aeca4","observation_id":"6e8bf332-c7ab-4cc7-80f6-30b07b7d1439","resolution":{"observed_at":"2026-08-06T22:16:41.136263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21046","last_updated":"2024-05-31T17:39:06Z","snapshot_observed_at":"2026-08-20T11:06:18.380104Z","submitted_at":"2024-05-31T17:39:06Z","title":"Exploratory Preference Optimization: Harnessing Implicit Q*-Approximation for Sample-Efficient RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21046","snapshot_observed_at":"2026-08-06T22:16:41.164165Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.164165Z"},"links":{"cited_paper":"/paper/2405.21046","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:63423ba148f9e1c6fc55982b6da1966768883fa129de461d25a526604d8a435d","observation_id":"96767539-3980-4239-b77a-43d95f4b0436","resolution":{"observed_at":"2026-08-06T22:16:41.164165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09780","last_updated":"2025-02-13T21:28:51Z","snapshot_observed_at":"2026-08-18T07:44:08.359696Z","submitted_at":"2025-02-13T21:28:51Z","title":"Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games","version":1},"cited_work":{"arxiv_id":"2502.09780","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.09780","snapshot_observed_at":"2026-08-06T22:16:41.766047Z","title":"Incentivize without Bonus: Provably Efficient Model-based Online Multi-agent RL for Markov Games","venue":"cs.LG","work_id":"7604c6f2-6387-4bc2-baea-5f8d68abea84","year":2025},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.207446Z"},"links":{"cited_paper":"/paper/2502.09780","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:aa77b87176176c02c769ba6a3829dcb6ff4b67ac689f7df8949b0a5662fc061e","observation_id":"4f1f6c9b-6aee-4768-be1b-f7710a86285f","resolution":{"observed_at":"2026-08-06T22:16:41.806555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:42.923530Z","title":"Zanette, D","venue":null,"work_id":"c5ad684b-4de2-4554-bc14-5629f259ce6b","year":1954},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.279713Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:3b525a51a022c412b5fd79b6149286e21af2b2b1bc3ba3825142082ccb427bb1","observation_id":"10127970-7d4e-49af-b5ff-daac192413ef","resolution":{"observed_at":"2026-08-06T22:16:42.966818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19332","last_updated":"2024-11-05T07:21:18Z","snapshot_observed_at":"2026-08-21T10:32:54.222058Z","submitted_at":"2024-05-29T17:59:07Z","title":"Self-Exploring Language Models: Active Preference Elicitation for Online Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19332","snapshot_observed_at":"2026-08-06T22:16:41.348358Z","title":"Zhang, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.348358Z"},"links":{"cited_paper":"/paper/2405.19332","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:6176e8b0ca4144580e7e58fbcc411e66059798041be1dd019a71839b3a4f1e59","observation_id":"9fac93e6-af53-45fd-9ed7-fd92bd07a6d4","resolution":{"observed_at":"2026-08-06T22:16:41.348358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01962","last_updated":"2023-06-30T13:05:42Z","snapshot_observed_at":"2026-08-20T14:15:17.091112Z","submitted_at":"2022-11-03T16:42:40Z","title":"GEC: A Unified Framework for Interactive Decision Making in MDP, POMDP, and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.01962","snapshot_observed_at":"2026-08-06T22:16:41.423136Z","title":"Zhong, W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.423136Z"},"links":{"cited_paper":"/paper/2211.01962","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:f32000c0f825c4a5b01f2535f46ca582590efb10298bde59be5e7358a982ea1b","observation_id":"83d01094-2d25-4e16-962b-af20816a1a09","resolution":{"observed_at":"2026-08-06T22:16:41.423136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:42.814574Z","title":"Lemma 1 (Freedman’s inequality, Lemma D.2 in Liu et al","venue":null,"work_id":"d3e5d290-4c36-4633-889a-1e4826973d76","year":2024},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.475713Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:644bd4cc5819f249e462e7d206dc83166b40f177ae0e02def296a693bfb1a0b7","observation_id":"5b3b281a-35fc-4323-9584-723b350d38b8","resolution":{"observed_at":"2026-08-06T22:16:42.879115Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:42.572792Z","title":"(113) This gives the desired result","venue":null,"work_id":"c2943c9a-ac75-41b4-a934-3fe8c8ad9cd9","year":2024},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.557045Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:1247f60bf918d467fda1415257e86c7d15d068274bdfb9cf2fa6d8b6346cc479","observation_id":"02be0b09-c698-4362-8ffc-b6ac32f2e126","resolution":{"observed_at":"2026-08-06T22:16:42.625708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03710","last_updated":"2025-05-06T17:32:39Z","snapshot_observed_at":"2026-08-17T09:33:26.970157Z","submitted_at":"2025-05-06T17:32:39Z","title":"Actor-Critics Can Achieve Optimal Sample Efficiency","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03710","snapshot_observed_at":"2026-08-06T22:16:41.051490Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.051490Z"},"links":{"cited_paper":"/paper/2505.03710","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:995589b400aefb0288e2b14f09920623d6948f1ceb0822f2bbc00c43abe5e06f","observation_id":"fa730b0c-dc34-43b0-b04b-20de32495e77","resolution":{"observed_at":"2026-08-06T22:16:41.051490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.09515","last_updated":"2023-03-07T16:26:05Z","snapshot_observed_at":"2026-08-16T16:38:05.654786Z","submitted_at":"2022-08-19T19:01:30Z","title":"Spectral Decomposition Representation for Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.09515","snapshot_observed_at":"2026-08-06T22:16:40.943404Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.943404Z"},"links":{"cited_paper":"/paper/2208.09515","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:37b5f3cc6276e37849468ea5f0f135467829f6dcbf459e1401ce262d94da36a6","observation_id":"6295c50d-8ffc-42ef-bed6-8beab192319b","resolution":{"observed_at":"2026-08-06T22:16:40.943404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:16:40.674415Z","title":"Moulin, G","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.674415Z"},"links":{"citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:00c2ad2d80dd0d1db3f735fad9c132d81d943211dcf0f2c184c10fc0724616ec","observation_id":"f1f62133-3519-4288-a00b-dea1468a5493","resolution":{"observed_at":"2026-08-06T22:16:40.674415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19320","last_updated":"2025-02-19T00:51:58Z","snapshot_observed_at":"2026-08-16T13:48:04.333875Z","submitted_at":"2024-05-29T17:51:42Z","title":"Value-Incentivized Preference Optimization: A Unified Approach to Online and Offline RLHF","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19320","snapshot_observed_at":"2026-08-06T22:16:40.137931Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.137931Z"},"links":{"cited_paper":"/paper/2405.19320","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:dc9cdf6c53d06fddab8053f87cb06b444a43f83a94086e85a34fbb0aecd07dd7","observation_id":"4a0cc76b-5241-46e8-9451-e38e9786a534","resolution":{"observed_at":"2026-08-06T22:16:40.137931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08560","last_updated":"2024-01-26T16:58:26Z","snapshot_observed_at":"2026-08-16T15:54:46.744721Z","submitted_at":"2023-02-16T20:10:06Z","title":"Dual RL: Unification and New Methods for Reinforcement and Imitation Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08560","snapshot_observed_at":"2026-08-06T22:16:41.004427Z","title":"Sikchi, Q","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:41.004427Z"},"links":{"cited_paper":"/paper/2302.08560","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:c9fcf464fabd0c065f3933283e8cdd8919e6ffd02509762923d4fe659aa5ed59","observation_id":"04308499-b75f-4399-8e8c-76d18a719431","resolution":{"observed_at":"2026-08-06T22:16:41.004427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02074","last_updated":"2019-12-04T16:06:10Z","snapshot_observed_at":"2026-08-18T04:12:50.632095Z","submitted_at":"2019-12-04T16:06:10Z","title":"AlgaeDICE: Policy Gradient from Arbitrary Experience","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02074","snapshot_observed_at":"2026-08-06T22:16:40.782168Z","title":"Nachum, Y","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.782168Z"},"links":{"cited_paper":"/paper/1912.02074","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:c6ca756f21ec647155b718b5002acfc4c93ae810ca9eef48ac143c0172933b52","observation_id":"98ac1154-60b2-4318-8992-0d33fe16af9f","resolution":{"observed_at":"2026-08-06T22:16:40.782168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T22:16:40.421569Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.421569Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:868e27e70c425c9f2fffbb7135deee3d55b653143942f224aa5af66e7cfae92e","observation_id":"b92eef3e-3625-48b6-9da3-4c3413137018","resolution":{"observed_at":"2026-08-06T22:16:40.421569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.13487","last_updated":"2023-07-11T16:47:42Z","snapshot_observed_at":"2026-08-18T13:55:54.042604Z","submitted_at":"2021-12-27T02:53:44Z","title":"The Statistical Complexity of Interactive Decision Making","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.13487","snapshot_observed_at":"2026-08-06T22:16:40.263471Z","title":"Foster, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.263471Z"},"links":{"cited_paper":"/paper/2112.13487","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:cc6d30bfef28587d21a63a99986a188012721d5d7f678c49eab183aa3421f908","observation_id":"514554d3-7a2a-4049-bfd0-f334b90c48a4","resolution":{"observed_at":"2026-08-06T22:16:40.263471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07041","last_updated":"2020-03-30T23:58:02Z","snapshot_observed_at":"2026-08-14T20:59:32.269582Z","submitted_at":"2017-05-19T15:10:21Z","title":"Posterior sampling for reinforcement learning: worst-case regret bounds","version":3},"cited_work":{"arxiv_id":"1705.07041","doi":null,"metadata_source":"pith","pith_arxiv_id":"1705.07041","snapshot_observed_at":"2026-08-06T22:16:42.211692Z","title":"Posterior sampling for reinforcement learning: worst-case regret bounds","venue":"cs.LG","work_id":"ddc9dc43-1c98-4f6c-85ed-8c13131dd78e","year":2017},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.034564Z"},"links":{"cited_paper":"/paper/1705.07041","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:06243146b024f4fc4c2a17948f182aade77fa1d8a016910ea2656dce31e714f4","observation_id":"349dbb18-227f-4524-b75a-bd9eba90e993","resolution":{"observed_at":"2026-08-06T22:16:42.253497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08053","last_updated":"2021-06-15T11:21:06Z","snapshot_observed_at":"2026-08-20T12:17:32.920639Z","submitted_at":"2021-06-15T11:21:06Z","title":"On the Power of Multitask Representation Learning in Linear MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08053","snapshot_observed_at":"2026-08-06T22:16:40.625859Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.625859Z"},"links":{"cited_paper":"/paper/2106.08053","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:7b8ffd5cd9ea8c3cbe55f383f7a9cec288f2624c0976d6ae80f3246428a5775b","observation_id":"662386d8-9299-4b4a-abb8-3cd756b6a977","resolution":{"observed_at":"2026-08-06T22:16:40.625859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.01866","last_updated":"2020-01-09T19:08:09Z","snapshot_observed_at":"2026-08-11T23:21:08.502885Z","submitted_at":"2020-01-07T02:59:59Z","title":"Reinforcement Learning via Fenchel-Rockafellar Duality","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.01866","snapshot_observed_at":"2026-08-06T22:16:40.717812Z","title":"Nachum and B","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T22:16:40.717812Z"},"links":{"cited_paper":"/paper/2001.01866","citing_paper":"/paper/2506.22401"},"observation_digest":"sha256:1e54ea78556956a433b947411ce3bdb5ed925be8c6094af69f2736001e1273e8","observation_id":"0d4a63e2-91b3-4398-b508-2a2dfbd53315","resolution":{"observed_at":"2026-08-06T22:16:40.717812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.22401","last_updated":"2025-06-27T17:18:43Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-18T07:44:47.122609Z","submitted_at":"2025-06-27T17:18:43Z","title":"Exploration from a Primal-Dual Lens: Value-Incentivized Actor-Critic Methods for Sample-Efficient Online RL"},"reference_resolution":{"displayed":25,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":25},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 25 of 25 outbound references and 0 inbound Pith citation observations for arXiv:2506.22401."}