{"as_of":"2026-08-10T06:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0b32537426312f8ecd2f0b540de4d52db65d7bd0fa6a450ea94eb39ddaedd78b","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T01:16:05.392554Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.00133/citation-record","integrity":"/paper/2608.00133/integrity","json":"/paper/2608.00133/citation-record.json","paper":"/paper/2608.00133"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2402.15391","last_updated":"2024-02-23T15:47:26Z","snapshot_observed_at":"2026-08-03T22:04:23.465893Z","submitted_at":"2024-02-23T15:47:26Z","title":"Genie: Generative Interactive Environments","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15391","snapshot_observed_at":"2026-08-04T01:16:00.032259Z","title":"Genie: Generative interactive environments","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.032259Z"},"links":{"cited_paper":"/paper/2402.15391","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:0c62078740d3989164aa7bf22ed2eb44f10725609f63b062e79cad4cc1170f92","observation_id":"1cf5dcd9-b8a1-419b-aa3c-91e86c17e31a","resolution":{"observed_at":"2026-08-04T01:16:00.032259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-06T11:56:09.577967Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-04T01:16:00.255389Z","title":"Soft actor-critic for discrete action settings.arXiv preprint arXiv:1910.07207,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.255389Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:2d432040b33bcab2b75a418533b4ea8fc8a9a11234511e54b29e195f9cc99099","observation_id":"5d729623-6732-4a19-b31b-0a77d438c5f2","resolution":{"observed_at":"2026-08-04T01:16:00.255389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-04T01:16:00.904068Z","title":"D4RL: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.904068Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:2f3f1571d7ba0cfe2095b6f9d2a28c1ec33e03f37e7d68e7ce71ac794ab77907","observation_id":"19a6c79a-b59f-43f6-8274-d9d792531765","resolution":{"observed_at":"2026-08-04T01:16:00.904068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14375","last_updated":"2022-09-28T19:04:43Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-28T19:04:43Z","title":"Improving alignment of dialogue agents via targeted human judgements","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.14375","snapshot_observed_at":"2026-08-04T01:16:01.233701Z","title":"Improving alignment of dialogue agents via targeted human judgements.arXiv preprint arXiv:2209.14375,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.233701Z"},"links":{"cited_paper":"/paper/2209.14375","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:322d10d6aab881d403d2a613a124f69e48adddb1352515d1851df1f81d5fccdc","observation_id":"31225c62-a18c-46fb-88a0-af4f988b016a","resolution":{"observed_at":"2026-08-04T01:16:01.233701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16879","last_updated":"2024-04-22T22:52:14Z","snapshot_observed_at":"2026-08-07T23:18:52.810329Z","submitted_at":"2024-04-22T22:52:14Z","title":"Learning Control Barrier Functions and their application in Reinforcement Learning: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16879","snapshot_observed_at":"2026-08-04T01:16:01.383193Z","title":"Learning control barrier functions and their application in safe reinforcement learning.arXiv preprint arXiv:2404.16879,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.383193Z"},"links":{"cited_paper":"/paper/2404.16879","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:704e4ca1e68598efb97d6a39ac49aa8631a9a4549bd00954d0ad93996e093d43","observation_id":"a08dccf8-c088-4d9e-b847-916002338995","resolution":{"observed_at":"2026-08-04T01:16:01.383193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-04T01:16:01.503990Z","title":"World models.arXiv preprint arXiv:1803.10122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.503990Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:4804ab4ed7c3dea99df3bb2a4d94d56f149de28859edaa3d62473a21159e4a03","observation_id":"de2b33a2-0b57-466f-8614-b71b6d803c74","resolution":{"observed_at":"2026-08-04T01:16:01.503990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-04T01:16:01.634487Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.634487Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:bd2c948ceace96a7ba9ad7e43eed2186a08643d62a55ac1744beb8828271243a","observation_id":"660c4eec-04d9-462b-9a86-a13ec9e8fdda","resolution":{"observed_at":"2026-08-04T01:16:01.634487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-04T01:16:01.795109Z","title":"Mastering diverse domains through world models.arXiv preprint arXiv:2301.04104,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.795109Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:d24735f822c5a7d3b4f168db5f075ec9fada46359d33b7e1bd1dcf58a4778e1a","observation_id":"939e08b6-7e87-40a3-b90f-c4bbb335b98a","resolution":{"observed_at":"2026-08-04T01:16:01.795109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:16:01.917358Z","title":"Nicklas Hansen, Xiaolong Wang, and Hao Su","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.917358Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:c77c6f8ccc955f38996df5ae85aa64f0013894cedda61ab97cc78c650958962d","observation_id":"ac4b6f60-c66a-4eaf-96f4-0e00bcbea1f6","resolution":{"observed_at":"2026-08-04T01:16:01.917358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02034","last_updated":"2022-03-16T13:38:46Z","snapshot_observed_at":"2026-08-08T23:30:41.427380Z","submitted_at":"2021-10-05T13:28:11Z","title":"Dropout Q-Functions for Doubly Efficient Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02034","snapshot_observed_at":"2026-08-04T01:16:02.055354Z","title":"Dropout Q-functions for doubly efficient reinforcement learning.arXiv preprint arXiv:2110.02034,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.055354Z"},"links":{"cited_paper":"/paper/2110.02034","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:dbf533c90feed746c6424b6f633643223be2ad2a1653046031bf92cb1b501b0f","observation_id":"d8ce6f9a-7e3d-42fd-89cc-5cd12670f129","resolution":{"observed_at":"2026-08-04T01:16:02.055354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07691","snapshot_observed_at":"2026-08-04T01:16:02.181961Z","title":"Orpo: Monolithic preference optimization without reference model.arXiv preprint arXiv:2403.07691,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.181961Z"},"links":{"cited_paper":"/paper/2403.07691","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:156e5c01e01ef62f1430879234e02f619bd83964699111897aa5200fd0c995a9","observation_id":"e0381c50-8cf6-4358-b515-fd7660eb2a3e","resolution":{"observed_at":"2026-08-04T01:16:02.181961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06463","last_updated":"2026-04-07T21:07:19Z","snapshot_observed_at":"2026-07-06T22:54:57.597183Z","submitted_at":"2026-04-07T21:07:19Z","title":"A Control Barrier Function-Constrained Model Predictive Control Framework for Safe Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06463","snapshot_observed_at":"2026-08-04T01:16:02.348797Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.348797Z"},"links":{"cited_paper":"/paper/2604.06463","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:e1f40d81f142a56f343baa45919d97a9cb4013473c46b57bf40948377f0cc698","observation_id":"b90705c3-4260-4570-8d66-8578008d5b04","resolution":{"observed_at":"2026-08-04T01:16:02.348797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12599","last_updated":"2025-06-03T02:14:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T02:48:14Z","title":"Kimi k1.5: Scaling Reinforcement Learning with LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12599","snapshot_observed_at":"2026-08-04T01:16:02.479731Z","title":"Kimi k1.5: Scaling reinforcement learning with LLMs.arXiv preprint arXiv:2501.12599,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.479731Z"},"links":{"cited_paper":"/paper/2501.12599","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:3606d30246cdd9f44800129d743e42dbd1fcf52c752781aeb0000fc8b505fb0c","observation_id":"003ce360-d3df-4b6e-a8b5-bfc5c88f9d4b","resolution":{"observed_at":"2026-08-04T01:16:02.479731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.09128","last_updated":"2026-05-12T01:20:33Z","snapshot_observed_at":"2026-07-06T22:11:57.493922Z","submitted_at":"2025-08-12T17:55:36Z","title":"A Review On Safe Reinforcement Learning Using Lyapunov and Barrier Functions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.09128","snapshot_observed_at":"2026-08-04T01:16:02.605676Z","title":"Kushwaha and Zachary A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.605676Z"},"links":{"cited_paper":"/paper/2508.09128","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:c3be493314e5a58cd12fa0acc5a08f0bb36372824f22c58b8b45e1579f410a10","observation_id":"c36079bd-0e77-47aa-8dcc-6f668a865610","resolution":{"observed_at":"2026-08-04T01:16:02.605676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-04T01:16:02.842764Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643,","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.842764Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:ab5f22232caa15919dea81c39370707ee3281cc6b38b54274bd37b0745bb458b","observation_id":"f032c323-925b-4c94-a2a7-1ac27b426398","resolution":{"observed_at":"2026-08-04T01:16:02.842764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-04T01:16:02.984462Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.984462Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:d385741b91a998507aae4974ca5be86ac4b1dacdcfe5d93f9cd2c37430d913e3","observation_id":"2447f6b6-a2e2-4152-bfa4-e84abf25a818","resolution":{"observed_at":"2026-08-04T01:16:02.984462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:16:03.103819Z","title":"Online finetuning decision transformers with pure reinforcement learning gradients.arXiv preprint arXiv:2601.00167,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.103819Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:5ea7712588050e237220499ae854bad8bf5716191392fa70ea5bb2c05c7c1e05","observation_id":"37e71f77-bbbb-44d0-91f7-57e680ea3b4e","resolution":{"observed_at":"2026-08-04T01:16:03.103819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:16:03.214093Z","title":"Efficient soft actor-critic with LLM-based action-level guidance for continuous control.arXiv preprint arXiv:2603.17468,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.214093Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:3af1e9cddd6a75baa263a1dc87ce4a151e8f70ae7a406db51b2d7e04c6f5ea49","observation_id":"e3ccb85a-90fc-470d-be34-1ff702fb6851","resolution":{"observed_at":"2026-08-04T01:16:03.214093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14734","last_updated":"2024-11-01T20:05:19Z","snapshot_observed_at":"2026-08-03T02:02:15.325394Z","submitted_at":"2024-05-23T16:01:46Z","title":"SimPO: Simple Preference Optimization with a Reference-Free Reward","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14734","snapshot_observed_at":"2026-08-04T01:16:03.318050Z","title":"SimPO: Simple preference optimization with a reference-free reward.arXiv preprint arXiv:2405.14734,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.318050Z"},"links":{"cited_paper":"/paper/2405.14734","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:fe02930fa92b24fc0b6716fc1c0ee7200e4359c2a21a359e53ef60d1a825dde0","observation_id":"1982bf56-417a-4cf6-96dd-b3a3fcb8088c","resolution":{"observed_at":"2026-08-04T01:16:03.318050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-04T01:16:03.481502Z","title":"Accelerating online reinforce- ment learning with offline datasets.arXiv preprint arXiv:2006.09359,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.481502Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:b19d8cd517cec37215179f4bbfd406aef1521aee07a51f8d453ea1320010f3c7","observation_id":"0be68d9f-2ae8-4ba6-ae08-d67bf38cf296","resolution":{"observed_at":"2026-08-04T01:16:03.481502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:16:03.603115Z","title":"How to train your latent control barrier function.arXiv preprint arXiv:2511.18606,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.603115Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:56bdb1e800af00deb36e0431e04b7ff73bdfa3bd733c3c5a1c718a09d4f4c2ba","observation_id":"0fb2f258-a3a1-47d9-bf4b-d0edba7f3b23","resolution":{"observed_at":"2026-08-04T01:16:03.603115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-04T01:16:03.719913Z","title":"Advantage-weighted regression: Simple and scalable off-policy reinforcement learning.arXiv preprint arXiv:1910.00177,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.719913Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:06369e91e2fc03c472fb68da6a523a8dbe61166a6862072787d44db7126d44e2","observation_id":"eba33d7a-9c7d-4e48-911d-9ecc8dcb641b","resolution":{"observed_at":"2026-08-04T01:16:03.719913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1506.02438","last_updated":"2018-10-20T18:55:07Z","snapshot_observed_at":"2026-08-09T23:04:15.431743Z","submitted_at":"2015-06-08T11:12:48Z","title":"High-Dimensional Continuous Control Using Generalized Advantage Estimation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1506.02438","snapshot_observed_at":"2026-08-04T01:16:03.861262Z","title":"Jordan, and Pieter Abbeel","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.861262Z"},"links":{"cited_paper":"/paper/1506.02438","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:3eb6f7a5b9566a3cdf0eae794f9de9aab0ae6bb596fd2ba86abde36900a1b070","observation_id":"20b1dd58-bc4b-4dfb-95d6-1c4d4426f72d","resolution":{"observed_at":"2026-08-04T01:16:03.861262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-04T01:16:04.047614Z","title":"Deepseekmath: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.047614Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:d1bbe35c466f8e1970672d25d3f3e31952a818743069b21ed54d9b51f3dc7224","observation_id":"c2111a3b-d4cc-4667-9bf6-50479691f8eb","resolution":{"observed_at":"2026-08-04T01:16:04.047614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13548","last_updated":"2025-05-10T07:10:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-20T14:46:48Z","title":"Towards Understanding Sycophancy in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13548","snapshot_observed_at":"2026-08-04T01:16:04.213789Z","title":"Towards understanding sycophancy in language models.arXiv preprint arXiv:2310.13548,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.213789Z"},"links":{"cited_paper":"/paper/2310.13548","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:b11aadff90fc01ff8d719f205209ca2517837b1da3031da10c5d4327318afd2a","observation_id":"7d9d1167-8c6e-4b9e-ad31-8ac7a273542f","resolution":{"observed_at":"2026-08-04T01:16:04.213789Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.13085","last_updated":"2025-03-05T21:08:30Z","snapshot_observed_at":"2026-08-07T00:50:39.663102Z","submitted_at":"2022-09-27T00:32:44Z","title":"Defining and Characterizing Reward Hacking","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.13085","snapshot_observed_at":"2026-08-04T01:16:04.347683Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.347683Z"},"links":{"cited_paper":"/paper/2209.13085","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:a192e4c49c6d2c13d2de04efd5597148ac20f4111ebed58d0eadd0fa758a7275","observation_id":"81b3cc78-0585-4d7a-b578-47d9d18788a3","resolution":{"observed_at":"2026-08-04T01:16:04.347683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02311","last_updated":"2025-03-04T06:13:53Z","snapshot_observed_at":"2026-08-07T17:31:28.753900Z","submitted_at":"2025-03-04T06:13:53Z","title":"Target Return Optimizer for Multi-Game Decision Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02311","snapshot_observed_at":"2026-08-04T01:16:04.426467Z","title":"Targetreturnoptimizerformulti-gamedecisiontransformer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.426467Z"},"links":{"cited_paper":"/paper/2503.02311","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:24a20b8fa802391d2cd4c3e5a4077f70f8c5ae8cd921038b558eb8ba79fcfd7b","observation_id":"f028ebc4-b306-4de3-b1a3-e632691dbc5f","resolution":{"observed_at":"2026-08-04T01:16:04.426467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17032","last_updated":"2025-11-02T13:42:19Z","snapshot_observed_at":"2026-07-06T18:51:06.750136Z","submitted_at":"2024-07-24T06:35:05Z","title":"Gymnasium: A Standard Interface for Reinforcement Learning Environments","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17032","snapshot_observed_at":"2026-08-04T01:16:04.504223Z","title":"Gymnasium: A standard interface for reinforcement learning environments.arXiv preprint arXiv:2407.17032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.504223Z"},"links":{"cited_paper":"/paper/2407.17032","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:414f0c106501902862123c965484ba0a22596fd25b9ab356e893a616b8c516e4","observation_id":"cd40a34f-c338-47fc-83fb-c2ffc2a069b5","resolution":{"observed_at":"2026-08-04T01:16:04.504223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-04T01:16:04.573522Z","title":"Deep reinforcement learning and the deadly triad.arXiv preprint arXiv:1812.02648,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.573522Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:2f227fb8ff4f21c930f87cafb97fd6e9db8fdc4051a314b139ce9547b95f3d93","observation_id":"86f53e1a-e55a-4873-8bf7-d53c20bd42a8","resolution":{"observed_at":"2026-08-04T01:16:04.573522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-07-06T08:39:58.361914Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-04T01:16:04.732902Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.732902Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:1a2242487e011829347122bf34772c538f98b6bab2137b6a229ec38efcf267cb","observation_id":"32df2db8-2384-4a95-ad7f-c374e6cba6e4","resolution":{"observed_at":"2026-08-04T01:16:04.732902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12122","last_updated":"2024-09-18T16:45:37Z","snapshot_observed_at":"2026-07-06T19:17:41.512834Z","submitted_at":"2024-09-18T16:45:37Z","title":"Qwen2.5-Math Technical Report: Toward Mathematical Expert Model via Self-Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12122","snapshot_observed_at":"2026-08-04T01:16:04.833754Z","title":"Qwen2.5-math technical report: Toward mathematical expert model via self- improvement.arXiv preprint arXiv:2409.12122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.833754Z"},"links":{"cited_paper":"/paper/2409.12122","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:dbbda57fd5bf77b942365ada900c5fc206c2bf2af8858d6178cb43f38996a699","observation_id":"0f70470f-965c-4888-9572-6e5548bbf852","resolution":{"observed_at":"2026-08-04T01:16:04.833754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.14959","last_updated":"2026-06-22T08:18:39Z","snapshot_observed_at":"2026-08-08T11:10:51.233406Z","submitted_at":"2025-10-16T17:58:58Z","title":"CBF-RL: Safety Filtering Reinforcement Learning in Training with Control Barrier Functions","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.14959","snapshot_observed_at":"2026-08-04T01:16:04.938739Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.938739Z"},"links":{"cited_paper":"/paper/2510.14959","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:1a7e261faa1922718bdd9764c81b6a410b914897335e5f61df92c2aa4f1b218c","observation_id":"c55b42e7-558f-4eba-b3d0-6d259ae5a02c","resolution":{"observed_at":"2026-08-04T01:16:04.938739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.01825","last_updated":"2023-09-13T03:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-03T15:34:01Z","title":"Scaling Relationship on Learning Mathematical Reasoning with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.01825","snapshot_observed_at":"2026-08-04T01:16:05.018389Z","title":"Scaling relationship on learning mathematical reasoning with large language models.arXiv preprint arXiv:2308.01825,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:05.018389Z"},"links":{"cited_paper":"/paper/2308.01825","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:dab0447a68e3697510d013bd6210230074efa55513f88b0c4462670a5bf43d14","observation_id":"143bfbb0-2a4a-4c98-989e-e08eb895f6c5","resolution":{"observed_at":"2026-08-04T01:16:05.018389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02547","last_updated":"2026-04-17T18:09:08Z","snapshot_observed_at":"2026-08-03T09:07:42.489237Z","submitted_at":"2025-09-02T17:46:26Z","title":"The Landscape of Agentic Reinforcement Learning for LLMs: A Survey","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02547","snapshot_observed_at":"2026-08-04T01:16:05.118218Z","title":"Zhang et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:05.118218Z"},"links":{"cited_paper":"/paper/2509.02547","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:b668b64992bb86c6e6e19f3a126b223c33669452565a9f765971162700dcd2a8","observation_id":"48e765bb-755c-4a4d-b144-67fca8c8c5da","resolution":{"observed_at":"2026-08-04T01:16:05.118218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01275","last_updated":"2018-04-30T04:24:26Z","snapshot_observed_at":"2026-08-03T12:09:42.690927Z","submitted_at":"2017-12-04T06:03:26Z","title":"A Deeper Look at Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01275","snapshot_observed_at":"2026-08-04T01:16:05.188515Z","title":"LLMs augmented hierarchical reinforcement learning with action primitives for long-horizon manipulation tasks.Scientific Reports, 15: 36779, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:05.188515Z"},"links":{"cited_paper":"/paper/1712.01275","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:f8ed4d5e2afaf2ce9d00a07107a24fc95fce5c674e001ed8f25e2399ac9a8907","observation_id":"4c85bfbf-931a-4c06-855b-513c0439af37","resolution":{"observed_at":"2026-08-04T01:16:05.188515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10081","last_updated":"2024-11-20T13:52:42Z","snapshot_observed_at":"2026-08-06T23:15:53.680841Z","submitted_at":"2022-09-21T03:01:36Z","title":"Revisiting Discrete Soft Actor-Critic","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10081","snapshot_observed_at":"2026-08-04T01:16:05.266717Z","title":"Revisiting discrete soft actor-critic.arXiv preprint arXiv:2209.10081,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:05.266717Z"},"links":{"cited_paper":"/paper/2209.10081","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:6d0c57173430099a1f1e4d8476412219f8f3cdda080c6c17fcb6445c7f802855","observation_id":"24175e85-901a-43af-9389-604fd30d8ee7","resolution":{"observed_at":"2026-08-04T01:16:05.266717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08593","last_updated":"2020-01-08T23:02:36Z","snapshot_observed_at":"2026-08-08T07:44:49.921146Z","submitted_at":"2019-09-18T17:33:39Z","title":"Fine-Tuning Language Models from Human Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08593","snapshot_observed_at":"2026-08-04T01:16:05.392554Z","title":"Ziegler, Nisan Stiennon, Jeffrey Wu, et al","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:05.392554Z"},"links":{"cited_paper":"/paper/1909.08593","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:06e465a4004299e90d2c76139eca978f6261eec9d6692662fcc1e394728b6486","observation_id":"c24103c3-e6bd-4024-95f5-f708b29fdf6f","resolution":{"observed_at":"2026-08-04T01:16:05.392554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T01:16:00.626146Z","title":"Deepseek-r1: Incentivizing reasoning capability in LLMs via reinforcement learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":1993,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.626146Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:903b7ce9f531a0d701f9a00011e5725feb33f9b00fe521c6dc00dc36a1b2100f","observation_id":"92e11276-cd1e-490d-8e1a-aedfd8134572","resolution":{"observed_at":"2026-08-04T01:16:00.626146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-07-06T16:13:07.384791Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-04T01:16:02.721065Z","title":"RLAIF vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:02.721065Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:c73e5b3ab6ad8300b85a2b0152e6bef6d371edde175af5ba14acd0341e689e30","observation_id":"c61d01a7-d41e-460e-8973-022a07b7e244","resolution":{"observed_at":"2026-08-04T01:16:02.721065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:16:00.759217Z","title":"Delgrange et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.759217Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:b45325f9912951c76e2a2659c15f5ec8c1ea42df8f1b3f46d4f99c2375589960","observation_id":"aadab0d4-40bf-47b7-b095-e1c44389b842","resolution":{"observed_at":"2026-08-04T01:16:00.759217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06343","last_updated":"2025-03-31T14:56:08Z","snapshot_observed_at":"2026-08-09T00:12:51.486185Z","submitted_at":"2025-03-08T21:29:20Z","title":"Studying the Interplay Between the Actor and Critic Representations in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06343","snapshot_observed_at":"2026-08-04T01:16:01.059094Z","title":"Studying the interplay between the actor and critic representations in deep reinforcement learning.arXiv preprint arXiv:2503.06343,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:01.059094Z"},"links":{"cited_paper":"/paper/2503.06343","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:99ab90ea58dadd0e838e10693c2644f9ee3774b886ccf57d468ccfd3cac830af","observation_id":"2988e363-41f8-479f-90ad-9503baae70d0","resolution":{"observed_at":"2026-08-04T01:16:01.059094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06565","last_updated":"2016-07-25T17:23:29Z","snapshot_observed_at":"2026-07-06T05:00:46.434335Z","submitted_at":"2016-06-21T13:37:05Z","title":"Concrete Problems in AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.06565","snapshot_observed_at":"2026-08-04T01:15:59.412376Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-04T01:15:59.412376Z"},"links":{"cited_paper":"/paper/1606.06565","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:20dc9944798815d5f5342a14559c0ebcf36f6db683fe455c001deb667f875258","observation_id":"4fea863f-6f42-45cc-b4a4-e1fa5487bc6d","resolution":{"observed_at":"2026-08-04T01:15:59.412376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-04T01:15:59.641823Z","title":"Constitutional AI: Harmlessness from AI feedback.arXiv preprint arXiv:2212.08073,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T01:15:59.641823Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:0cbffb9ec13c9a32412092898860246c265b34c00d1483dbee38c907c099c8bf","observation_id":"99bc4337-08ae-461a-9bd6-1a2396b92e0c","resolution":{"observed_at":"2026-08-04T01:15:59.641823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:15:59.525068Z","title":"2024 ACM a.m","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T01:15:59.525068Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:54e8eec69fb67687e19d6f1cd3805b2b6a70747a781cf9ce453d6f07be51287b","observation_id":"dd6d564e-4faf-4ee3-81ba-5f8d7d12e922","resolution":{"observed_at":"2026-08-04T01:15:59.525068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T01:16:00.362479Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.362479Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:1113f41bcb34f6fcd6aa816c52de5d6883048230eb95028afac73c0ce2d804c3","observation_id":"1888d178-3b4b-42cf-ad81-6866b1b56b89","resolution":{"observed_at":"2026-08-04T01:16:00.362479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.01456","last_updated":"2025-09-26T09:25:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-03T15:43:48Z","title":"Process Reinforcement through Implicit Rewards","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.01456","snapshot_observed_at":"2026-08-04T01:16:00.507444Z","title":"Process reinforcement through implicit rewards.arXiv preprint arXiv:2502.01456,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.507444Z"},"links":{"cited_paper":"/paper/2502.01456","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:45ed54520a5742e774470e1ac8620f54834b18060d43ad78c21596d6abb17a79","observation_id":"5a6e3e87-58e6-4cb1-a27d-90494072aec9","resolution":{"observed_at":"2026-08-04T01:16:00.507444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-08-09T23:24:21.399948Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-08-04T01:15:59.863844Z","title":"Openai gym.arXiv preprint arXiv:1606.01540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T01:15:59.863844Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:bff837a8e1dce647475fc88af4296107a40cb02b50834aac8473bb55b5c9b85e","observation_id":"e73967b3-8b6f-4d3a-a30b-9f3235461112","resolution":{"observed_at":"2026-08-04T01:15:59.863844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06193","last_updated":"2023-08-25T19:39:32Z","snapshot_observed_at":"2026-07-06T13:41:14.687081Z","submitted_at":"2022-08-12T09:54:11Z","title":"Diffusion Policies as an Expressive Policy Class for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06193","snapshot_observed_at":"2026-08-04T01:16:04.653728Z","title":"Hunt, and Mingyuan Zhou","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:04.653728Z"},"links":{"cited_paper":"/paper/2208.06193","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:289b278610e4091a2c28ef2220569b16fc816d364e6d9ca8d54f7cd7a580209c","observation_id":"65176c4b-f0e2-447f-8ebf-363b34b5ffdf","resolution":{"observed_at":"2026-08-04T01:16:04.653728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15217","last_updated":"2023-09-11T17:25:24Z","snapshot_observed_at":"2026-08-03T19:11:09.671782Z","submitted_at":"2023-07-27T22:29:25Z","title":"Open Problems and Fundamental Limitations of Reinforcement Learning from Human Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15217","snapshot_observed_at":"2026-08-04T01:16:00.139959Z","title":"Open problems and fundamental limitations of reinforcement learning from human feedback.arXiv preprint arXiv:2307.15217,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:00.139959Z"},"links":{"cited_paper":"/paper/2307.15217","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:5bf124492553d8e442afa21f4f8b9647ece2add309c85c25752457fe498b1591","observation_id":"bb622e9c-e10a-4359-bdc1-e8dd456c3d5e","resolution":{"observed_at":"2026-08-04T01:16:00.139959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T01:15:59.757963Z","title":"arXiv preprint","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T01:15:59.757963Z"},"links":{"citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:89ed5ef9d6a671ebefcc82eae1973e1b4cdeb5afbbd824242ba5658a710ab11c","observation_id":"009c66c3-36ad-4803-b635-9cdf1538379b","resolution":{"observed_at":"2026-08-04T01:15:59.757963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-07-06T03:31:23.521122Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-04T01:16:03.400506Z","title":"Playing atari with deep reinforcement learning.arXiv preprint arXiv:1312.5602,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T01:16:03.400506Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2608.00133"},"observation_digest":"sha256:289a1e2a4991ff50881596156562573e1cbbadb4adc84b4c5374643070e19dbe","observation_id":"b13b507c-def0-489c-8653-a2b950219aed","resolution":{"observed_at":"2026-08-04T01:16:03.400506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.00133","last_updated":"2026-07-31T13:57:34Z","latest_version":1,"primary_category":"eess.SY","snapshot_observed_at":"2026-08-09T07:19:33.388480Z","submitted_at":"2026-07-31T13:57:34Z","title":"Deep Reinforcement Learning: From First Principles to Reasoning Models"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2608.00133."}