{"as_of":"2026-08-11T18:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bc98e5e3ee4ec85b30fcc25d26c1787103741ab0117d71ac12087289551ae9d8","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:46:40.962416Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T14:46:40.962416Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-10T14:46:40.998711Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"cited_work":{"arxiv_id":"2501.15034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15034","snapshot_observed_at":"2026-08-10T14:46:40.998711Z","title":"Divergence-Augmented Policy Optimization","venue":"cs.LG","work_id":"7214a9ce-8083-48d7-8315-0d4e1d6b5cc5","year":2025},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.962416Z"},"links":{"cited_paper":"/paper/2501.15034","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:7403e0618eed253e687996a7a5356ccf691f5cdcfc3fa0a55369909b6f0080cf","observation_id":"8fd24c70-8541-40a7-a58c-b2f77bbd94c0","resolution":{"observed_at":"2026-08-10T14:46:41.005958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.15034/citation-record","integrity":"/paper/2501.15034/integrity","json":"/paper/2501.15034/citation-record.json","paper":"/paper/2501.15034"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1605.08695","last_updated":"2016-05-31T19:46:10Z","snapshot_observed_at":"2026-08-10T07:10:18.392798Z","submitted_at":"2016-05-27T15:49:50Z","title":"TensorFlow: A system for large-scale machine learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.08695","snapshot_observed_at":"2026-08-10T14:46:40.885943Z","title":"Abadi, P","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.885943Z"},"links":{"cited_paper":"/paper/1605.08695","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:45a6fb6b4fb5907690bbfa37c98a98ec61539c3fa92bb1db350c5e92230a0e62","observation_id":"7f844ae2-f8d4-4b4c-b01c-44b4f3316422","resolution":{"observed_at":"2026-08-10T14:46:40.885943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.08562","last_updated":"2017-03-30T05:00:30Z","snapshot_observed_at":"2026-07-30T22:48:59.601842Z","submitted_at":"2015-12-28T23:59:12Z","title":"Taming the Noise in Reinforcement Learning via Soft Updates","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1512.08562","snapshot_observed_at":"2026-08-10T14:46:40.901446Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.901446Z"},"links":{"cited_paper":"/paper/1512.08562","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:23b9c322c06a417f1294345301ccc9ed2686ea2bd63789366319e1ea5d8af82c","observation_id":"97bbab76-2bba-4b81-aa95-deac999c1547","resolution":{"observed_at":"2026-08-10T14:46:40.901446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:46:41.213700Z","title":null,"venue":null,"work_id":"4fdf5f5a-54b1-4f43-8667-63c45059d485","year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.917022Z"},"links":{"citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:4bb98d5f782b8903c34e103493b0d119d6dd04427fe5860a5a892792ce9b154b","observation_id":"0260c940-db19-4d58-924b-e0e36da41efd","resolution":{"observed_at":"2026-08-10T14:46:41.217949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:46:40.934019Z","title":null,"venue":null,"work_id":null,"year":1928},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.934019Z"},"links":{"citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:f7c70705e71de4665236b32c023f72cfe2e1ff1dd4c1ad1259d1efbaf8aa8f86","observation_id":"6419e812-9cde-47ee-9b83-2cba3d7c5183","resolution":{"observed_at":"2026-08-10T14:46:40.934019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.06440","last_updated":"2018-10-14T22:54:38Z","snapshot_observed_at":"2026-08-05T07:10:19.910840Z","submitted_at":"2017-04-21T08:33:59Z","title":"Equivalence Between Policy Gradients and Soft Q-Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.06440","snapshot_observed_at":"2026-08-10T14:46:40.941589Z","title":"Schulman, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.941589Z"},"links":{"cited_paper":"/paper/1704.06440","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:2a6623fb504762716c1dad30a50a48ae8717b40d75685dd49af375bb725fb2de","observation_id":"64beb63e-5657-47de-b85e-6a571a04c30a","resolution":{"observed_at":"2026-08-10T14:46:40.941589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01224","last_updated":"2017-07-10T14:38:10Z","snapshot_observed_at":"2026-08-10T11:54:22.061417Z","submitted_at":"2016-11-03T23:21:32Z","title":"Sample Efficient Actor-Critic with Experience Replay","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01224","snapshot_observed_at":"2026-08-10T14:46:40.945463Z","title":null,"venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.945463Z"},"links":{"cited_paper":"/paper/1611.01224","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:48effa1e6bb920e42a7812e20e317ef7d27a7edbdd072de84cedfed384174c53","observation_id":"ff3e350a-0b57-491c-bcbf-5751fcd76c4c","resolution":{"observed_at":"2026-08-10T14:46:40.945463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:46:41.168438Z","title":"episodic life","venue":null,"work_id":"b46a5770-d6ca-4316-a4d6-21954a89f60c","year":2015},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.954832Z"},"links":{"citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:4c35c1583f622479bc74ff16150eb5117ad49c2b5b71639cdb4f42782f1fcd6f","observation_id":"abe0769c-773e-427d-ae32-1c1cfe4ae64a","resolution":{"observed_at":"2026-08-10T14:46:41.171930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:46:41.157394Z","title":null,"venue":null,"work_id":"2448270b-1fc5-4fbc-9497-e0c3a98da1d2","year":2018},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.958324Z"},"links":{"citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:36f6ffb6c226f5a4271cbe3e6d1742f9f02c216425554c9ddafb5abc4c52dcff","observation_id":"fad0416a-92c2-4dc8-9ea5-99e148600d82","resolution":{"observed_at":"2026-08-10T14:46:41.160877Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"cited_work":{"arxiv_id":"2501.15034","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.15034","snapshot_observed_at":"2026-08-10T14:46:40.998711Z","title":"Divergence-Augmented Policy Optimization","venue":"cs.LG","work_id":"7214a9ce-8083-48d7-8315-0d4e1d6b5cc5","year":2025},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.962416Z"},"links":{"cited_paper":"/paper/2501.15034","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:7403e0618eed253e687996a7a5356ccf691f5cdcfc3fa0a55369909b6f0080cf","observation_id":"8fd24c70-8541-40a7-a58c-b2f77bbd94c0","resolution":{"observed_at":"2026-08-10T14:46:41.005958Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-07-06T05:43:40.624942Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-10T14:46:40.937680Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":1983,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.937680Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:84dfbc65b4bb492786ff100589175a1f0d139026f6c84d79eacd9138f3ccd4bc","observation_id":"7cf5fd38-49d3-4d3f-bc41-cb127a3de1d9","resolution":{"observed_at":"2026-08-10T14:46:40.937680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.00933","last_updated":"2018-03-02T16:21:46Z","snapshot_observed_at":"2026-07-06T06:26:20.207918Z","submitted_at":"2018-03-02T16:21:46Z","title":"Distributed Prioritized Experience Replay","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.00933","snapshot_observed_at":"2026-08-10T14:46:40.920694Z","title":"Horgan, J","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":1997,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.920694Z"},"links":{"cited_paper":"/paper/1803.00933","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:5c9414dd8ac84d42225be50697b4c73bfff0e70404d5fd37c077a9921bac9e7a","observation_id":"917e466e-b7f6-44c7-bca1-937fc3c786cb","resolution":{"observed_at":"2026-08-10T14:46:40.920694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:46:41.199116Z","title":null,"venue":null,"work_id":"55683ac3-6298-49a1-8e88-ddf9f97253a4","year":2005},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.924989Z"},"links":{"citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:291f5074fad23935aabf2a9725d89e0b99d2ecd1adca65f82a974d0de9bf398c","observation_id":"4d6d90b9-b282-40ac-9659-9c9d353d11e7","resolution":{"observed_at":"2026-08-10T14:46:41.203702Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T14:46:40.929280Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.929280Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:285b2fccf97ace6d771fa6c6f8ab85f47f40cec1cae9a01955704331847cc420","observation_id":"d2847209-d254-481e-8b15-a2ae258b2ed3","resolution":{"observed_at":"2026-08-10T14:46:40.929280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.01561","last_updated":"2018-06-28T06:54:39Z","snapshot_observed_at":"2026-07-06T06:21:49.379500Z","submitted_at":"2018-02-05T18:47:30Z","title":"IMPALA: Scalable Distributed Deep-RL with Importance Weighted Actor-Learner Architectures","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.01561","snapshot_observed_at":"2026-08-10T14:46:40.896067Z","title":"Espeholt, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2011,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.896067Z"},"links":{"cited_paper":"/paper/1802.01561","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:735ffdf565d71a98b39bcf384a428e7221463f6c062c2d818e05f00aad3d78d0","observation_id":"6467b71b-4615-43d1-9bfb-192d6363263d","resolution":{"observed_at":"2026-08-10T14:46:40.896067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T14:46:41.178817Z","title":"human starts","venue":null,"work_id":"fda44821-797e-4c77-a523-1b429609d79d","year":2013},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.950996Z"},"links":{"citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:17dc479a95f75b772a094fb7687fe19dcf40b6bd49f4dfd730f19f4720457a36","observation_id":"a8aab43f-8290-4770-b58b-b32373e9bc34","resolution":{"observed_at":"2026-08-10T14:46:41.182627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.08165","last_updated":"2017-07-21T20:25:54Z","snapshot_observed_at":"2026-08-10T11:58:02.183839Z","submitted_at":"2017-02-27T07:16:41Z","title":"Reinforcement Learning with Deep Energy-Based Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1702.08165","snapshot_observed_at":"2026-08-10T14:46:40.905786Z","title":"Haarnoja, H","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.905786Z"},"links":{"cited_paper":"/paper/1702.08165","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:9554ac1cc9bbfbc603909a741572d729c440d199d94b102cd3b36aa9ce13b985","observation_id":"6e128694-c735-47d5-9d9c-d983c8bf1b58","resolution":{"observed_at":"2026-08-10T14:46:40.905786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1801.01290","last_updated":"2018-08-08T21:27:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-01-04T09:50:50Z","title":"Soft Actor-Critic: Off-Policy Maximum Entropy Deep Reinforcement Learning with a Stochastic Actor","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1801.01290","snapshot_observed_at":"2026-08-10T14:46:40.910483Z","title":"Haarnoja, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.910483Z"},"links":{"cited_paper":"/paper/1801.01290","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:0b46903fdf77aab91ed1f0ada25d4abbacc96803901e7b2baadc66891e8243ee","observation_id":"77170a9f-57d9-4f00-9079-2733b297d719","resolution":{"observed_at":"2026-08-10T14:46:40.910483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.10528","last_updated":"2017-05-30T10:07:31Z","snapshot_observed_at":"2026-08-07T17:23:05.276464Z","submitted_at":"2017-05-30T10:07:31Z","title":"Constrained Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.10528","snapshot_observed_at":"2026-08-10T14:46:40.891011Z","title":"Achiam, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T14:46:40.891011Z"},"links":{"cited_paper":"/paper/1705.10528","citing_paper":"/paper/2501.15034"},"observation_digest":"sha256:b3e1f97821568e4d39a08b983d91c01eb53765fe7a6328a19cd1d89cbdbe1e65","observation_id":"90ca5d42-3891-436d-8d06-30a494554142","resolution":{"observed_at":"2026-08-10T14:46:40.891011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.15034","last_updated":"2025-01-25T02:35:46Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-11T11:30:21.206308Z","submitted_at":"2025-01-25T02:35:46Z","title":"Divergence-Augmented Policy Optimization"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":1,"verified_fuzzy":2},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 1 inbound Pith citation observation for arXiv:2501.15034."}