{"as_of":"2026-08-08T09:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:305919b9cbb304adae289f419297e4dca28c63e02a38ffe8f3e2d2fbdb03667d","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:54:12.780877Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07040/citation-record","integrity":"/paper/2506.07040/integrity","json":"/paper/2506.07040/citation-record.json","paper":"/paper/2506.07040"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:17.377807Z","title":"On the theory of policy gradient methods: Optimality, approximation, and distribution shift","venue":null,"work_id":"0115c44f-1993-40a1-83c9-e6c5b3fad1e2","year":2021},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.616419Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:bddd6b22ee3e94b57f6cf2527193f242f11dba78a0442a73fb992a10fa65f242","observation_id":"ef70f0d3-4b29-48c4-9680-c2a66502970f","resolution":{"observed_at":"2026-08-07T05:54:17.474894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:17.200425Z","title":"Bounded semigroups of matrices","venue":null,"work_id":"6bb1b64c-08d6-4772-8ecf-2cb497beb407","year":1992},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.707205Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:e00baaf043e59909f2e1da30aecb7a939d04a0796a6d2a69c4ddb650dbaeea7b","observation_id":"9965448c-ccfe-4d5c-8797-9056a40d7186","resolution":{"observed_at":"2026-08-07T05:54:17.297043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.976155Z","title":"Single sample path-based optimization of markov chains","venue":null,"work_id":"f921d4c0-5f7b-4409-ac17-2829d31f5825","year":1999},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.869727Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:d15b9a0eb7baad019aa4bf686f49ada6132e2b810e12fa994c898125a0800291","observation_id":"9ef97421-6307-40dd-bbb8-6844ed0b88fa","resolution":{"observed_at":"2026-08-07T05:54:17.111742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:09.997942Z","title":"Sample complexity of distributionally robust average-reward reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:09.997942Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:4552626e517bb06a3c62fd1191eea295f12c2398775457b2a796a9f734074d34","observation_id":"869a3cd3-5da4-42c8-8d7b-7d5f54645349","resolution":{"observed_at":"2026-08-07T05:54:09.997942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.801727Z","title":"Distributionally robust stochastic optimization with W asserstein distance","venue":null,"work_id":"419e05d7-3da2-424a-8634-e2bbe9af74a9","year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.170591Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:8d852d5a04af0dbb372f7da85e66391ce0deb39aba6b554f0c3374a786b904b1","observation_id":"61e2f1a7-d41a-4e96-be53-613e8558d664","resolution":{"observed_at":"2026-08-07T05:54:16.886561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.652330Z","title":"Distributionally robust stochastic optimization with wasserstein distance","venue":null,"work_id":"3391533f-50b8-4fff-ac06-871ae86f6b63","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.326835Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:1f4dc66eb995eff107110184794000071a38d7b3831673430e361dcba63abcc1","observation_id":"67561d46-dd68-4551-9c2d-42cc6c7d39d6","resolution":{"observed_at":"2026-08-07T05:54:16.737358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.497466Z","title":"Sim2real in robotics and automation: Applications and challenges","venue":null,"work_id":"2ad70b6c-5ab3-48aa-8c3d-191a43d3ce02","year":2021},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.442042Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:61258fe7f079114aeafd49d35486efcf8dfe05ea7735e1dd0e24455838a0f53f","observation_id":"825f67de-894c-4c02-bc88-01753b950a87","resolution":{"observed_at":"2026-08-07T05:54:16.572891Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.312575Z","title":"A robust version of the probability ratio test","venue":null,"work_id":"b3013257-edff-45b8-aca4-57b004ebfc52","year":1965},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.553831Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:72c9fed896cf7e3f348c41235e082ead8e3c22404ee55c32ae79f03007232689","observation_id":"7f309759-8e64-451a-a29d-50e69cfd7db2","resolution":{"observed_at":"2026-08-07T05:54:16.386215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:16.144294Z","title":"Robust dynamic programming","venue":null,"work_id":"c5eb672e-b503-4332-9536-22e851885b60","year":2005},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.666749Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:eac36c173ce6f02cd8cb10a9589fc87a75601fdcdcb8d7aec24e9d221735bcea","observation_id":"ec7c81e9-8789-41b2-8b25-686b96860ea4","resolution":{"observed_at":"2026-08-07T05:54:16.227215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.929528Z","title":"Is q-learning provably efficient? Advances in neural information processing systems , 31, 2018","venue":null,"work_id":"7b61a24c-efd4-4a89-ad51-b14835b00339","year":2018},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.782406Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:b66cc612503b55e53d9f8c46fb103bf9de72b478cfb48fc8975a3159b14bc52b","observation_id":"19f8b178-7a01-43f6-9858-f64fdbe6a7ff","resolution":{"observed_at":"2026-08-07T05:54:15.999655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.744360Z","title":"Learning robust policy against disturbance in transition dynamics via state-conservative policy optimization","venue":null,"work_id":"06350dbd-7afe-4c06-803a-16ad24afd1c1","year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:10.965109Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:2d5697c43af7f11328218596e1b308aa87ba7b42714a0813ea3cc06ac264278c","observation_id":"c88f8ffa-82e1-41a6-9ab9-6bcc34a47707","resolution":{"observed_at":"2026-08-07T05:54:15.849079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.571003Z","title":"Policy gradient for rectangular robust markov decision processes","venue":null,"work_id":"743c994b-79e4-4a5c-b089-f7ac60c5119c","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.050545Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:12f8a38f4df63a71ad3702381378ce2be2941e27617900ac0831addd90ed128d","observation_id":"c16151e2-04d4-42a4-a6bf-94912749d28a","resolution":{"observed_at":"2026-08-07T05:54:15.670114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10579","last_updated":"2023-06-10T21:34:45Z","snapshot_observed_at":"2026-07-06T13:54:53.084096Z","submitted_at":"2022-09-21T18:10:28Z","title":"First-order Policy Optimization for Robust Markov Decision Process","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10579","snapshot_observed_at":"2026-08-07T05:54:11.213481Z","title":"First-order policy optimization for robust markov decision process","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.213481Z"},"links":{"cited_paper":"/paper/2209.10579","citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:b0ff400f297c2bbc517abb13e00f639afc618490df75500ce8de67252ab3463e","observation_id":"6b2800b2-64ec-4e46-b8c4-4e056478a7aa","resolution":{"observed_at":"2026-08-07T05:54:11.213481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.398425Z","title":"Reinforcement learning in robust markov decision processes","venue":null,"work_id":"bb83c025-89c5-442d-90c9-934905c7e1f0","year":2013},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.344482Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:a6183447300a9f05877beb72c45ce7f048de6f307a39f12a1f9de5bdb33aaa0f","observation_id":"1bf65130-af37-4ad7-840a-5349010729bd","resolution":{"observed_at":"2026-08-07T05:54:15.458906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.217571Z","title":"Robustness in markov decision problems with uncertain transition matrices","venue":null,"work_id":"80dde80d-49be-41d8-b833-976b2eb6b499","year":2003},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.492619Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:0d651fcd7c26eb302ae2941e928f26be8e516a50a03d0106d76d67ea483774ba","observation_id":"62b951b7-0427-4e8c-8d7e-707f1a52bc06","resolution":{"observed_at":"2026-08-07T05:54:15.289414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12462","last_updated":"2026-06-21T21:20:26Z","snapshot_observed_at":"2026-08-07T15:43:38.702434Z","submitted_at":"2025-05-18T15:34:45Z","title":"Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis","version":3},"cited_work":{"arxiv_id":"2505.12462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.12462","snapshot_observed_at":"2026-08-07T05:54:13.187637Z","title":"Model-Free Robust Average-Reward Reinforcement Learning with Sample Complexity Analysis","venue":"cs.LG","work_id":"23268430-2383-42f9-9f98-616f69786c86","year":2025},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.619397Z"},"links":{"cited_paper":"/paper/2505.12462","citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:221df35293123a0f94f4d23a382a1b162edfb52e5e5819816828e901685d68cc","observation_id":"fccc989e-2617-4fa9-b37f-b38b700b2ac1","resolution":{"observed_at":"2026-08-07T05:54:13.272094Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:15.028330Z","title":"Policy optimization for robust average reward mdps","venue":null,"work_id":"3e88ccb0-02bb-4f75-ade3-20ebb96a05bc","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.789338Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:fa67fd9045978bbef40e5c959c791c8701886328a4c3a8ea0f3dfa4c66be4765","observation_id":"71dc82ed-7b97-47dd-8580-1cefb697f5b9","resolution":{"observed_at":"2026-08-07T05:54:15.126484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.855147Z","title":"u nderhauf, Oliver Brock, Walter Scheirer, Raia Hadsell, Dieter Fox, J \\","venue":null,"work_id":"97fe2915-2544-4a67-a39f-9b40e6763f4f","year":2018},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.912786Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:dbf5bb1336e52f3055fe477dd514738dfffea97dad37b8dfefcb2e4185e3fe32","observation_id":"d18695a6-251c-4982-8605-2b4a842c01f6","resolution":{"observed_at":"2026-08-07T05:54:14.913558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.00603","last_updated":"2022-12-01T15:57:58Z","snapshot_observed_at":"2026-07-06T14:25:40.781383Z","submitted_at":"2022-12-01T15:57:58Z","title":"Near Sample-Optimal Reduction-based Policy Learning for Average Reward MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.00603","snapshot_observed_at":"2026-08-07T05:54:11.972128Z","title":"Near sample-optimal reduction-based policy learning for average reward mdp","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:11.972128Z"},"links":{"cited_paper":"/paper/2212.00603","citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:5ceb387a3e9bd86606674fac9844c2722f62dcbf2128681447568d1505878bcc","observation_id":"a5de33fd-8f62-47de-b381-294e48cdd827","resolution":{"observed_at":"2026-08-07T05:54:11.972128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.663699Z","title":"A finite sample complexity bound for distributionally robust q-learning","venue":null,"work_id":"84a6bd62-2b27-4798-907c-237bbed5de30","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.041666Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:25882682d27a19aedb860ad0df56d87107a1f4dbe4468d54d63d44fb86eba5b2","observation_id":"93319adb-9ce9-47a1-b0a8-f6ca9d1f2e87","resolution":{"observed_at":"2026-08-07T05:54:14.746932Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.514064Z","title":"Sample complexity of variance-reduced distributionally robust q-learning","venue":null,"work_id":"6e41e029-da53-41fb-8985-49f6aaaf0f89","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.176391Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:83e807800e245047f5e4043090035c69e4259d0e2cdf45884524228efcccdec5","observation_id":"97c97d62-421b-4f4c-ae57-4b937c851a91","resolution":{"observed_at":"2026-08-07T05:54:14.582387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.362081Z","title":"Robust average-reward markov decision processes","venue":null,"work_id":"8350b0d2-c0b9-414f-82c3-bfba177c311b","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.288138Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:218a5e45cc906834b9dc868adc060e9c847cd87db60f37601096dc953fe5a621","observation_id":"734d1291-44f4-4525-afbe-f989b6af7e69","resolution":{"observed_at":"2026-08-07T05:54:14.431435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.171731Z","title":"Robust average-reward reinforcement learning","venue":null,"work_id":"fb92ed4b-5d4e-4d2b-87f0-e2eef8093cf5","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.366541Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:ed55c298efd94bb979807fa6fb1fd84a639255f8c2ce64f167198cb5559614dd","observation_id":"b1942abc-4d0c-4301-9d6a-10be62db657d","resolution":{"observed_at":"2026-08-07T05:54:14.269153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:14.008504Z","title":"Model-free robust average-reward reinforcement learning","venue":null,"work_id":"4a693807-25b3-468f-b9c5-6ba47658c656","year":2023},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.439077Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:282d5835c1dfa93c8a682005657b60d23215883afeea0f3ff5d670f80ca7b6aa","observation_id":"5e0f1919-a5d5-4225-89fe-f4557761741c","resolution":{"observed_at":"2026-08-07T05:54:14.072906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.818353Z","title":"Policy gradient method for robust reinforcement learning","venue":null,"work_id":"5ad1ec2e-3285-4a13-9d0b-bb50076dfa15","year":2022},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.514568Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:99721d9e1c37178e53ab8a907fc47570b86f104bf3fa743080217b3e0a53d729","observation_id":"126f3854-5a0f-4100-be64-f9c5f82dfeac","resolution":{"observed_at":"2026-08-07T05:54:13.920610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.682787Z","title":"Model-free reinforcement learning in infinite-horizon average-reward markov decision processes","venue":null,"work_id":"9f4e3e13-afb4-4561-b93e-94bb3fbd5db4","year":2020},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.593503Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:0089ac3013b1593f54355e01d3c120c01c106c0249270a4d03801f526fdcb7f9","observation_id":"06666b7c-fa97-4d1e-8f68-9f7089ee3c9a","resolution":{"observed_at":"2026-08-07T05:54:13.733990Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.16816","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:12.974116Z","title":"Finite-sample analysis of policy evaluation for robust average reward reinforcement learning","venue":null,"work_id":"0677bbcc-e545-4e27-ab4b-3e79f8b36ea3","year":2025},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.692896Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:970d541db12478b3d3ffc431dd5b2c004f839a51a83aac644ef6633cd93b55a9","observation_id":"8431c331-d2a7-44ed-b314-063e4a2c122d","resolution":{"observed_at":"2026-08-07T05:54:13.058498Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:54:13.499943Z","title":"Natural actor-critic for robust reinforcement learning with function approximation","venue":null,"work_id":"25dbaae5-7506-48d9-921c-9448ccab4684","year":2024},"citing_paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T05:54:12.780877Z"},"links":{"citing_paper":"/paper/2506.07040"},"observation_digest":"sha256:2df32e5c8e9bb3a1300b74e40bcbedbecee99c1a750aabb8fdac4ee1851b8f52","observation_id":"bf156b68-91e8-421d-837f-e06af6c5b5ae","resolution":{"observed_at":"2026-08-07T05:54:13.578820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.07040","last_updated":"2026-07-13T02:54:44Z","latest_version":4,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T08:44:26.506196Z","submitted_at":"2025-06-08T08:26:27Z","title":"Efficient Q-Learning and Actor-Critic Methods for Robust Average-Reward Reinforcement Learning"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":3,"verified_exact":2,"verified_fuzzy":23},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2506.07040."}