{"as_of":"2026-08-16T05:18:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:837085a2fc3294cfa34e330d4d0678dbc28cd1cedb850a09fa29417c4b2aa688","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:13:57.717789Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-15T08:41:52.119405Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-15T08:45:19.217416Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"cited_work":{"arxiv_id":"2501.09080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Average-reward soft actor-critic","venue":null,"work_id":"9e7c754a-93b7-428a-9355-97ee36d91834","year":2025},"citing_paper":{"arxiv_id":"2603.19910","last_updated":"2026-05-13T08:07:02Z","snapshot_observed_at":"2026-08-14T05:32:36.034877Z","submitted_at":"2026-03-20T12:48:26Z","title":"Learning Adaptive Parameter Policies for Nonlinear Bayesian Filtering","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-15T08:41:52.119405Z"},"links":{"cited_paper":"/paper/2501.09080","citing_paper":"/paper/2603.19910"},"observation_digest":"sha256:c3ebcf2b4bd0f7158158914681138d360825fe5500d9581356789d0ba63256c5","observation_id":"2f999352-14a3-4199-b542-99f5bf01bf69","resolution":{"observed_at":"2026-05-15T08:45:19.219042Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"cited_work":{"arxiv_id":"2501.09080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.09080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Average-reward soft actor-critic","venue":null,"work_id":"9e7c754a-93b7-428a-9355-97ee36d91834","year":2025},"citing_paper":{"arxiv_id":"2605.12112","last_updated":"2026-05-12T13:29:10Z","snapshot_observed_at":"2026-08-12T16:04:04.492089Z","submitted_at":"2026-05-12T13:29:10Z","title":"When Policy Entropy Constraint Fails: Preserving Diversity in Flow-based RLHF via Perceptual Entropy","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T05:50:13.653022Z"},"links":{"cited_paper":"/paper/2501.09080","citing_paper":"/paper/2605.12112"},"observation_digest":"sha256:f9d3b2616eb3cc18ac4ce4d8b62f27f405947e75a8c76577f5258d4c2341671b","observation_id":"3fb8d06e-83b7-44b8-bd36-ffba1af6ba03","resolution":{"observed_at":"2026-05-13T05:52:22.146444Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.09080/citation-record","integrity":"/paper/2501.09080/integrity","json":"/paper/2501.09080/citation-record.json","paper":"/paper/2501.09080"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2004.13649","last_updated":"2021-03-07T16:37:37Z","snapshot_observed_at":"2026-08-16T04:03:26.547476Z","submitted_at":"2020-04-28T16:48:16Z","title":"Image Augmentation Is All You Need: Regularizing Deep Reinforcement Learning from Pixels","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.13649","snapshot_observed_at":"2026-08-10T20:13:57.551979Z","title":"Image augmentation is all you need: Regularizing deep reinforcement learning from pixels","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.551979Z"},"links":{"cited_paper":"/paper/2004.13649","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:83b116c8469569e322318fbf1f43c8972c2b5ca4653f2dcbf557397ba2fc3197","observation_id":"f0146d23-1cdb-4608-9a76-fdb7bbe79c2a","resolution":{"observed_at":"2026-08-10T20:13:57.551979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.05800","last_updated":"2024-09-28T20:07:19Z","snapshot_observed_at":"2026-08-15T09:03:19.566778Z","submitted_at":"2022-05-11T23:02:46Z","title":"Stochastic first-order methods for average-reward Markov decision processes","version":6},"cited_work":{"arxiv_id":"2205.05800","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.05800","snapshot_observed_at":"2026-08-10T20:13:58.144562Z","title":"Stochastic first-order methods for average-reward Markov decision processes","venue":"cs.LG","work_id":"9a1b40b4-73cf-422b-a45f-3e6288ac9c4b","year":2022},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.565005Z"},"links":{"cited_paper":"/paper/2205.05800","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:56a210019508183e9276a07163b5ca442b769af5a8c3fa9a4b611a534a6e2d30","observation_id":"f2a6e11c-6dc1-4c5a-b861-10be3ea7f69c","resolution":{"observed_at":"2026-08-10T20:13:58.151359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.767740Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"582367c0-1f82-49ad-9217-bd6f5a71d4a9","year":2025},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.574195Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:b2486b30df239826dcaf68a9ec2c343ee6b2d42a954eaa42628c1ca5e5adfbb0","observation_id":"6c73f66b-967c-4f76-8a4d-f29c5bb2f753","resolution":{"observed_at":"2026-08-10T20:13:58.778193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02140","last_updated":"2019-11-27T07:28:55Z","snapshot_observed_at":"2026-08-14T00:43:05.286819Z","submitted_at":"2019-10-04T20:52:39Z","title":"Discounted Reinforcement Learning Is Not an Optimization Problem","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02140","snapshot_observed_at":"2026-08-10T20:13:57.580973Z","title":"Discounted reinforcement learning is not an optimization problem","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.580973Z"},"links":{"cited_paper":"/paper/1910.02140","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:f400dcc9a09b72e37bb75b274184bd31b4f0217bd5aa575b59e398545dae20e9","observation_id":"1b6fd44b-c44c-4368-894a-37436948a5c3","resolution":{"observed_at":"2026-08-10T20:13:57.580973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05103","last_updated":"2023-06-03T23:35:22Z","snapshot_observed_at":"2026-08-13T12:47:34.427200Z","submitted_at":"2023-02-10T08:03:09Z","title":"Controllability-Aware Unsupervised Skill Discovery","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05103","snapshot_observed_at":"2026-08-10T20:13:57.602182Z","title":"Controllability-aware unsupervised skill discovery","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.602182Z"},"links":{"cited_paper":"/paper/2302.05103","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:ea17f5231ddb5e95eca545ca5496a9ff27a99659f339a640c90d91abee6654a5","observation_id":"66e598d2-f89e-43f0-9f97-8c10a4339abe","resolution":{"observed_at":"2026-08-10T20:13:57.602182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.734929Z","title":"Relative entropy and free energy dualities: Con- nections to path integral and kl control","venue":null,"work_id":"9486d43f-b90d-4d09-996d-6c512dd4e086","year":2012},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.655247Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:a748c035969ff6a874bbf98d012cafc9006597dd040d681f0067a8bab9437b6b","observation_id":"4054c8d6-6ce6-4337-a5a7-ceaf8b0314e0","resolution":{"observed_at":"2026-08-10T20:13:58.746542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.11361","last_updated":"2019-11-26T06:11:34Z","snapshot_observed_at":"2026-08-12T13:17:36.653110Z","submitted_at":"2019-11-26T06:11:34Z","title":"Behavior Regularized Offline Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.11361","snapshot_observed_at":"2026-08-10T20:13:57.685681Z","title":"Behavior regularized offline reinforcement learning","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.685681Z"},"links":{"cited_paper":"/paper/1911.11361","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:091d6b8ebd022b7c24a2fa6fba0f420b6752e6efc44e6ecf3e5f08ae1e89f7df","observation_id":"2dcb0544-e426-4be8-bd63-58865362d663","resolution":{"observed_at":"2026-08-10T20:13:57.685681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07927","last_updated":"2024-10-10T13:54:11Z","snapshot_observed_at":"2026-08-13T12:10:07.465310Z","submitted_at":"2024-10-10T13:54:11Z","title":"Efficient Reinforcement Learning with Large Language Model Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07927","snapshot_observed_at":"2026-08-10T20:13:57.693280Z","title":"Efficient reinforcement learning with large language model priors","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.693280Z"},"links":{"cited_paper":"/paper/2410.07927","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:ff58c376009a89b938e85b700725806934c84efae501c97d530b3dceb222fe74","observation_id":"992949d2-b9ae-474e-a18b-77742679f4f9","resolution":{"observed_at":"2026-08-10T20:13:57.693280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.657286Z","title":"Finite sample analysis of average-reward TD learning and Q-learning","venue":null,"work_id":"cf98cae3-1067-482f-b166-c876c02554c2","year":2025},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.700341Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:b105e48f33e93c9d39c75d871498b17e1b5f41aba3ae7abe691db2fae937050f","observation_id":"da70aefb-c78e-47c8-8757-d9ca2eed2c29","resolution":{"observed_at":"2026-08-10T20:13:58.665375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.603070Z","title":"reward scale","venue":null,"work_id":"374d6d60-9864-4ad5-bb73-1ba4757ef4c2","year":2025},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.717789Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:78755ae26326ae2d615acd6017b5faeaa8b3cd23f111b5ddd39f94874efb16d2","observation_id":"f5849538-2447-48e1-8bb2-cd64b643977e","resolution":{"observed_at":"2026-08-10T20:13:58.613200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.03327","last_updated":"2020-06-23T12:45:09Z","snapshot_observed_at":"2026-07-06T08:55:52.355754Z","submitted_at":"2020-02-09T09:50:07Z","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","version":2},"cited_work":{"arxiv_id":"2002.03327","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.03327","snapshot_observed_at":"2026-08-10T20:13:57.864076Z","title":"Reward Tweaking: Maximizing the Total Reward While Planning for Short Horizons","venue":"cs.LG","work_id":"39ef5e6d-fba4-4cbe-a793-954756875b31","year":2020},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.638508Z"},"links":{"cited_paper":"/paper/2002.03327","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:0d2ca0210f31ba644629c3ea7fffb4cdfc040fd210a42cad47a66444eb2503b1","observation_id":"255b3875-7684-45df-b7fc-a09b7b8aa4b3","resolution":{"observed_at":"2026-08-10T20:13:57.873267Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.01114","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.378737Z","title":"Dense dynamics-aware reward synthesis: Integrating prior experience with demonstrations","venue":null,"work_id":"6525fd81-8391-4493-8b41-727d321bfba4","year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2003,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.536401Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:ea56a7f20c915e45c29022854a68806b2627d0850649de125b7f86d338b38ce8","observation_id":"1d97c46c-cecf-417d-b851-c37836d391bf","resolution":{"observed_at":"2026-08-10T20:13:58.392412Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:57.667433Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.667433Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:8dfab008fb9028c767aa2f4359b47e6e2126dee2d9a1e4d0aec3fff97f69dcb3","observation_id":"2ce61fd6-8b07-45bb-aece-fa51b7471a3f","resolution":{"observed_at":"2026-08-10T20:13:57.667433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.632980Z","title":"∞X k=1 r(st+k, at+k) − 1 β log π(at+k|st+k) π0(at+k|st+k) − θπ # , Qπ(st+1, at+1) = r(st+1, at+1) − θπ + E p,π","venue":null,"work_id":"dbd78ab2-126e-4167-9ed8-2eef89452b62","year":2017},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2010,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.708275Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:83bb6c244b58361fe2fbf0534c8c9be1548f62550d2ca31ddf6a60688a612db0","observation_id":"da48ec9a-95f8-4a39-876d-784452b9a9a8","resolution":{"observed_at":"2026-08-10T20:13:58.641196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T20:13:57.618379Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.618379Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:b76e671ff2feb9829e538e26ee00a0e1539f205e51bad22159214b62cc200ef1","observation_id":"711b2ad6-1711-4dfa-8ed3-b693e82bc4ae","resolution":{"observed_at":"2026-08-10T20:13:57.618379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.05905","last_updated":"2019-01-29T12:10:47Z","snapshot_observed_at":"2026-08-01T15:24:35.515954Z","submitted_at":"2018-12-13T04:44:29Z","title":"Soft Actor-Critic Algorithms and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.05905","snapshot_observed_at":"2026-08-10T20:13:57.506033Z","title":"Composable deep reinforcement learning for robotic manipulation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.506033Z"},"links":{"cited_paper":"/paper/1812.05905","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:d4a8ae80d68c38376a17e63a0858dc46befbae72d95405a2e5872fdbf6b8ca50","observation_id":"caafb751-ac41-488d-84a2-853866f4051f","resolution":{"observed_at":"2026-08-10T20:13:57.506033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01972","last_updated":"2024-08-04T09:26:00Z","snapshot_observed_at":"2026-08-15T18:53:59.860697Z","submitted_at":"2024-08-04T09:26:00Z","title":"RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2408.01972","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.01972","snapshot_observed_at":"2026-08-10T20:13:58.440169Z","title":"RVI-SAC: Average Reward Off-Policy Deep Reinforcement Learning","venue":"cs.LG","work_id":"9391718e-9fb0-4071-bada-83a355b08d95","year":2024},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.513390Z"},"links":{"cited_paper":"/paper/2408.01972","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:22f34cd321875520023ef61c52f1e985ea79817885087e75aa5b8115379917f7","observation_id":"b7e82671-4a27-4b1f-b938-ed127239bce1","resolution":{"observed_at":"2026-08-10T20:13:58.447879Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1705.07798","last_updated":"2017-05-22T15:06:25Z","snapshot_observed_at":"2026-08-14T20:59:03.934741Z","submitted_at":"2017-05-22T15:06:25Z","title":"A unified view of entropy-regularized Markov decision processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.07798","snapshot_observed_at":"2026-08-10T20:13:57.593356Z","title":"A unified view of entropy-regularized Markov decision processes","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.593356Z"},"links":{"cited_paper":"/paper/1705.07798","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:6d75dfeae4a5df2afdcbbb574ce87cfa6b1bc98cff2dff5e06a3e78ec07759af","observation_id":"94bd5da1-694f-4bd3-85f0-935f9e338448","resolution":{"observed_at":"2026-08-10T20:13:57.593356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00909","last_updated":"2018-05-20T20:03:59Z","snapshot_observed_at":"2026-08-08T20:31:18.897748Z","submitted_at":"2018-05-02T17:11:20Z","title":"Reinforcement Learning and Control as Probabilistic Inference: Tutorial and Review","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00909","snapshot_observed_at":"2026-08-10T20:13:57.558208Z","title":"Reinforcement learning and control as probabilistic inference: Tutorial and review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.558208Z"},"links":{"cited_paper":"/paper/1805.00909","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:4fcce5d7b26a399aa955db72060b1e5e440030bc2a8017e96c1e5901ee5a12b1","observation_id":"1d17c5b1-a7cd-4e07-989b-bc2d03398a94","resolution":{"observed_at":"2026-08-10T20:13:57.558208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:57.676411Z","title":"Dueling network architectures for deep reinforcement learning","venue":null,"work_id":null,"year":1995},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.676411Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:99adcf802a0b03ef03fee23572dbcc9418eaeb9d6a9215ef366a0ef884fe4573","observation_id":"71ced4dc-16f7-4a88-a920-be7660fe61c2","resolution":{"observed_at":"2026-08-10T20:13:57.676411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07587","last_updated":"2022-08-25T06:47:48Z","snapshot_observed_at":"2026-08-13T14:44:39.866166Z","submitted_at":"2022-08-16T08:00:43Z","title":"Making Reinforcement Learning Work on Swimmer","version":3},"cited_work":{"arxiv_id":"2208.07587","doi":null,"metadata_source":"pith","pith_arxiv_id":"2208.07587","snapshot_observed_at":"2026-08-10T20:13:58.544748Z","title":"Making Reinforcement Learning Work on Swimmer","venue":"cs.LG","work_id":"2a6e6e2b-20a8-4261-8355-b047cf3ec57d","year":2022},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.499060Z"},"links":{"cited_paper":"/paper/2208.07587","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:78486a0e15702bf4023e9cbe8377a7197e19e9fa241206ba6f942c9c8f42b10b","observation_id":"97ac2ec5-a628-4b86-a794-32b9c58f7522","resolution":{"observed_at":"2026-08-10T20:13:58.551293Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.05952","last_updated":"2016-02-25T17:55:31Z","snapshot_observed_at":"2026-08-15T17:33:32.559096Z","submitted_at":"2015-11-18T20:54:44Z","title":"Prioritized Experience Replay","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.05952","snapshot_observed_at":"2026-08-10T20:13:57.609321Z","title":"Prioritized experience replay.arXiv preprint arXiv:1511.05952,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.609321Z"},"links":{"cited_paper":"/paper/1511.05952","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:33a18a6939f0cf2f8ec2b9505305253591c5b1c801643d0a285e43a9660df593","observation_id":"b4e59e9f-f86a-4533-bde0-f99391d668fa","resolution":{"observed_at":"2026-08-10T20:13:57.609321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:13:58.801029Z","title":"The dependence of effective planning horizon on model accuracy","venue":null,"work_id":"9491205e-83a8-46f3-be08-59a57fd0cb25","year":2015},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.528380Z"},"links":{"citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:025747770a3d1375bf5058be3e2f00d58727ddafa390e5718c92a9c59a0ec4e1","observation_id":"db8c2468-c875-4db1-b9ea-441555c33241","resolution":{"observed_at":"2026-08-10T20:13:58.807736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.05990","last_updated":"2020-06-10T17:59:03Z","snapshot_observed_at":"2026-08-14T07:14:28.634639Z","submitted_at":"2020-06-10T17:59:03Z","title":"What Matters In On-Policy Reinforcement Learning? A Large-Scale Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.05990","snapshot_observed_at":"2026-08-10T20:13:57.486495Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-10T20:13:57.486495Z"},"links":{"cited_paper":"/paper/2006.05990","citing_paper":"/paper/2501.09080"},"observation_digest":"sha256:c4b91b7babf99c7bd3eb4c65d3261f0c1844f0482f163d3f4444af417ba12732","observation_id":"4d84dc87-68c2-43ee-b53f-4d0c58b22abf","resolution":{"observed_at":"2026-08-10T20:13:57.486495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.09080","last_updated":"2025-08-05T14:35:10Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T04:32:34.139354Z","submitted_at":"2025-01-15T19:00:46Z","title":"Average-Reward Soft Actor-Critic"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":5,"verified_fuzzy":6},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 2 inbound Pith citation observations for arXiv:2501.09080."}