{"as_of":"2026-08-08T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d6350fecc843bd28055123b646d89850af3d01c23810656cd7697be524b9d33d","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T14:31:38.795970Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.21314/citation-record","integrity":"/paper/2508.21314/integrity","json":"/paper/2508.21314/citation-record.json","paper":"/paper/2508.21314"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.883025Z","title":"Optimal control of Markov processes with incomplete state information I,","venue":null,"work_id":"e32cc4ea-a109-4dfb-ad00-ebefb892d3a5","year":1965},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.726619Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:af5c2bb54df05e45e4499c601c4a0bfd61753eb564d3abd2de974411e64a127c","observation_id":"33b9f85e-83ba-409e-91d2-23c77c4164d8","resolution":{"observed_at":"2026-08-05T14:31:47.937314Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.773342Z","title":"The optimal control of partially observable Markov processes over a finite horizon,","venue":null,"work_id":"1be5bc57-002a-4588-aee5-f10e72210afb","year":1973},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.806924Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:dde0806990db62633404ebf5ba76b596590fddc9437ff43e9fbee8efff3a7c15","observation_id":"dbbb163e-c714-4370-a962-f4a5485fde5b","resolution":{"observed_at":"2026-08-05T14:31:47.834699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.639134Z","title":"Approximate information state for approximate planning and reinforcement learning in partially observed systems,","venue":null,"work_id":"fd6b7fd2-eb31-470f-9627-940eff5e1dbd","year":2022},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.892758Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d9e928d93e8d94fdd463fd112d0ccb0832af13067deee1e84f4d0b59f575337a","observation_id":"d77d49cb-4264-422f-b0f9-d3a53976a919","resolution":{"observed_at":"2026-08-05T14:31:47.697682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.464363Z","title":"Deep recurrent Q-learning for partially observable MDPs","venue":null,"work_id":"8a0e98e3-c033-446e-945f-8c7791b81abd","year":2015},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:34.956485Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d10dcfcfcb39a5e2a6b59f4a8db0780c2aefc0eda348a2959ac5245ad3df18ed","observation_id":"e999cc6a-1015-4d36-921d-d4476f78ce11","resolution":{"observed_at":"2026-08-05T14:31:47.553437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.337321Z","title":"Deep variational reinforcement learning for POMDPs,","venue":null,"work_id":"824376eb-c10d-4e5e-a133-f56c47397ae8","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.023211Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:56ac70f592e080b03f9e3e4994ef53b2c397bf03e02677f261970db79a7cd4f9","observation_id":"159ff1fe-54b4-4789-9574-1d09c12456cc","resolution":{"observed_at":"2026-08-05T14:31:47.378652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07978","last_updated":"2018-05-24T14:13:20Z","snapshot_observed_at":"2026-07-06T05:39:20.517167Z","submitted_at":"2017-04-26T05:55:07Z","title":"On Improving Deep Reinforcement Learning for POMDPs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07978","snapshot_observed_at":"2026-08-05T14:31:35.087409Z","title":"On improving deep reinforcement learning for POMDPs,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.087409Z"},"links":{"cited_paper":"/paper/1704.07978","citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:a23d97f6a48bf59111212ce67c81ce4787ecb81b8d95d521445e6722a896e2d6","observation_id":"df196e73-64fd-43da-aa25-4a7373d4756a","resolution":{"observed_at":"2026-08-05T14:31:35.087409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:47.126969Z","title":"Memory-based deep reinforcement learning for POMDPs,","venue":null,"work_id":"af63832f-0e21-4db2-8b5b-421a8061a116","year":2021},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.154351Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2be8cc8ef7e2fe0cf11ff4ef1e81fa60cbbf6fad72191805553a58d5876408bc","observation_id":"c3d8e18d-0db7-49a9-bafb-4eb16fa66946","resolution":{"observed_at":"2026-08-05T14:31:47.181372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.944808Z","title":"Simple agent, complex envi- ronment: Efficient reinforcement learning with agent states,","venue":null,"work_id":"a9cdf1d6-07f5-411c-a7c0-e175638187c3","year":2022},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.246813Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:394b03e1cd498158ee610b7578d1079d0da416605a40261db58ab5d9457e301e","observation_id":"4a2642f5-2397-4d12-acc7-5abeb1c96664","resolution":{"observed_at":"2026-08-05T14:31:47.035610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.776402Z","title":"Agent-state based policies in POMDPs: Beyond belief-state MDPs,","venue":null,"work_id":"72364c67-4d57-4be5-be10-4469e23e9f0d","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.313591Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:551c419ef0318a41dd78132f72f309a36f391c436c0e7ff77bdfa2846106cc8e","observation_id":"c9d00860-670b-49b2-8744-f1c80c843f50","resolution":{"observed_at":"2026-08-05T14:31:46.868522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.580670Z","title":"Reinforcement learning algorithm for partially observable Markov decision problems,","venue":null,"work_id":"00097451-49f3-4ff1-ada1-f67020849155","year":1994},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.394078Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:22537c72a0c3219d944300fe5bf82c67398026cca923f3d4f8e9e0142ff2d26b","observation_id":"c3688d29-c638-4798-aae7-069a54b5d3aa","resolution":{"observed_at":"2026-08-05T14:31:46.655382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.423339Z","title":"Convergence of finite memory Q learning for POMDPs and near optimality of learned policies under filter stability,","venue":null,"work_id":"52a4b7d7-bf78-4ff8-89d0-0bfb82380013","year":2022},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.465534Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:5257ba44e5a5b6f4a8468cd122761a11532ef7cb765e61f139f016e0a020e052","observation_id":"b638296f-62e1-47f6-945b-fb580ccef064","resolution":{"observed_at":"2026-08-05T14:31:46.505820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.181912Z","title":"Periodic agent-state based Q- learning for POMDPs,","venue":null,"work_id":"154d5637-ecbd-460c-b436-459effdc7e82","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.530699Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:8c1b467c88a990edab59a2f35e201da55e3d425170ae0150447ed8662328e929","observation_id":"5f1c3ac5-5f2b-4344-9903-cbf5a49b5271","resolution":{"observed_at":"2026-08-05T14:31:46.315477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:46.012802Z","title":"Q-learning for stochastic control under general information structures and non-markovian environments,","venue":null,"work_id":"53825a15-8d78-4e94-8531-454c4d3870c8","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.595069Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d674ee90e295faba35c8e97d3dcd8dd8e795aa4e279e1de933e121a1484bf702","observation_id":"ede0e294-ec60-42b2-8ef0-664e944b95b9","resolution":{"observed_at":"2026-08-05T14:31:46.092609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.829090Z","title":"Reinforcement learning in non-Markovian environments,","venue":null,"work_id":"8df08afe-46a8-41f3-bcd3-c9179a54f390","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.677050Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2ce2c868b56b46bdfca75c7bf708b1c250e147f9db3c0f9c17838f81ec8e04c6","observation_id":"27d0ba31-a0cc-42fd-92bd-10fb265bd4f2","resolution":{"observed_at":"2026-08-05T14:31:45.943350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.606862Z","title":"On actor-critic algorithms,","venue":null,"work_id":"e3bc8387-a83e-454f-a5d2-8284ffed633e","year":2003},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.765001Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:37709742cd6d6da42c11a7fc8038ba2fd332e8e732151763a945b4431b07fd08","observation_id":"4b90a2be-c0ae-463a-94f0-7b2268e34eb4","resolution":{"observed_at":"2026-08-05T14:31:45.692776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-05T14:31:35.857345Z","title":"Proximal policy optimization algorithms,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.857345Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2b4ece232f43258f9b637aa078d2de27da1abae9cf71786d79306abd3ce7db89","observation_id":"54d6498f-8d3a-4649-9795-36c8460fc974","resolution":{"observed_at":"2026-08-05T14:31:35.857345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.439222Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor,","venue":null,"work_id":"265d95ac-0c8d-46fd-920e-135c51581ff2","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:35.945532Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:6c3d71c29e15c4598fd11a86778fb35e24a2a1ea707acf83d67877c9a4409025","observation_id":"6f54d08a-858c-4b4a-b90f-52c8076f127f","resolution":{"observed_at":"2026-08-05T14:31:45.541911Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.239519Z","title":"Under- standing the impact of entropy on policy optimization,","venue":null,"work_id":"8dff8ad5-71b3-4a6e-8675-ebb3a7f20650","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.011272Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:14a7c717b803adca55f1cbdf9594b6a3128f3ec0654095318cbdfdd64eecc4fa","observation_id":"a5c8d233-b142-4b9c-868f-66b4c9e65581","resolution":{"observed_at":"2026-08-05T14:31:45.364516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:45.064138Z","title":"Deep reinforcement learning that matters,","venue":null,"work_id":"2122f4cf-d786-4013-bafe-ba0f259f17ab","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.109162Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:821e67cc5338d0d9d06d4f7f464d6723573c8172244fb8149f84a74b363f6b08","observation_id":"df1c5df4-e07a-464b-9283-9e5d00a0a50c","resolution":{"observed_at":"2026-08-05T14:31:45.141508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.916793Z","title":"Relative entropy policy search,","venue":null,"work_id":"927a76c8-7b12-409f-bf6d-9336b8b30ec2","year":2010},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.204865Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:8e8edbd07d7f6efbc99bc57a1835ea45352d7f27a8cbc47c271e8902e7e653af","observation_id":"80329930-38b3-4885-89ff-c0b9b9139e3f","resolution":{"observed_at":"2026-08-05T14:31:44.996455Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.706215Z","title":"Trust region policy optimization,","venue":null,"work_id":"7fd9db3e-40f3-47c5-bc82-35ecc82ae4cf","year":2015},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.289776Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:75170d591d336bc4d18d003defbf53c9fee1eaae1e4c55f96606f296c5578db3","observation_id":"2b2236a6-2014-46c0-9a35-d4773476fc40","resolution":{"observed_at":"2026-08-05T14:31:44.767473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.477280Z","title":"A unified view of entropy- regularized Markov decision processes,","venue":null,"work_id":"cbd09678-406b-4494-ad0d-54b13cec3308","year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.379160Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:49913882c75dad25bb19fc3443799e0ea3d7653b01b47f46f9595dfb007616ca","observation_id":"d4ace202-8d60-4877-9cce-60afb331329e","resolution":{"observed_at":"2026-08-05T14:31:44.583680Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.261977Z","title":"A theory of regularized Markov decision processes,","venue":null,"work_id":"91ad3364-6871-4166-8c21-14853ae60fb9","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.429516Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:323370f76fbaf404895fe3df621013a7ba3d0a7045aa209a1e6aba1733f8f778","observation_id":"f8f17d5c-6661-4d4c-83be-9bea98b722b4","resolution":{"observed_at":"2026-08-05T14:31:44.369959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:44.013544Z","title":"Learning latent dynamics for planning from pixels,","venue":null,"work_id":"fbdbf996-36e6-474d-ac35-631ef263d3cf","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.495999Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d1ed43df52bbaf577aee65683d96a88ab1139e56239e6435b2134b87e537346c","observation_id":"e46cf0c7-e872-4fe8-a4e1-1c1fa766e711","resolution":{"observed_at":"2026-08-05T14:31:44.123291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.819586Z","title":"Solar: Deep structured representations for model-based reinforcement learning,","venue":null,"work_id":"32135bcd-d456-40b4-bb65-e8106ada7174","year":2019},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.562816Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:5a74586c734965da866b6d13f88e6154bb40d8b65f2e686ba0627e1868cb7300","observation_id":"21b2282f-babd-462a-9f4d-ed48a9b90bc4","resolution":{"observed_at":"2026-08-05T14:31:43.900185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.590289Z","title":"Dream to control: Learning behaviors by latent imagination,","venue":null,"work_id":"a6b0b382-9dac-4ea9-b8f8-abe859d785d9","year":2020},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.626433Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:3cade9d4aa4f9e52a7e2d38e7ad19b606ac0b9f48c7bc7b5271b64b8e110c511","observation_id":"f8683189-dbd0-49f4-8ad1-d2f855b17ca7","resolution":{"observed_at":"2026-08-05T14:31:43.687181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.414643Z","title":"Bridging state and history representations: Understanding self-predictive RL,","venue":null,"work_id":"ad291103-39a9-444e-aaa3-d3762d38ab5f","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.695055Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:b02c58de736e2aca6f236eedf50120733f51631c44c3408f5f096b927b9cc7ac","observation_id":"544e148c-7e2a-44be-afec-00c55961a26b","resolution":{"observed_at":"2026-08-05T14:31:43.482457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09388","last_updated":"2024-02-14T18:37:47Z","snapshot_observed_at":"2026-07-06T17:30:12.459471Z","submitted_at":"2024-02-14T18:37:47Z","title":"Entropy-regularized Point-based Value Iteration","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09388","snapshot_observed_at":"2026-08-05T14:31:36.781916Z","title":"Entropy-regularized point-based value iteration,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.781916Z"},"links":{"cited_paper":"/paper/2402.09388","citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:77c94ae5d240baffedd844084179f82b7af32a866ef0d961b6b59f54b2b7e8e0","observation_id":"e597574b-5bf1-44e1-9e16-55694b7ce7b8","resolution":{"observed_at":"2026-08-05T14:31:36.781916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.194058Z","title":"DESPOT: Online POMDP planning with regularization,","venue":null,"work_id":"42dc7cba-2e5a-43bd-8ac3-b514fb97f690","year":2013},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.867927Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:1a1297370296a5d4dc5980e92f818ce4532a4db3ceedbc8f750c7e64d330c672","observation_id":"b2bf9b10-891e-4cd9-bba0-2bff1acb2561","resolution":{"observed_at":"2026-08-05T14:31:43.322394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:43.000843Z","title":"Smoother entropy for active state trajectory estimation and obfuscation in POMDPs,","venue":null,"work_id":"5bccaebb-3318-4cc4-8526-295bb8d4e234","year":2023},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:36.936524Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:3b42777358a85f09da334f4f6f9ae98a68379e249a071758a3ad3244581c3d8e","observation_id":"e19dd16f-0ff1-430d-a5d8-04bc53bb48a3","resolution":{"observed_at":"2026-08-05T14:31:43.069938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.850369Z","title":"The limits of pure exploration in POMDPs: When the observation entropy is enough,","venue":null,"work_id":"46ea45c6-c222-4251-8ab5-2772a0b228e8","year":2024},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.017812Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:c8a18a22404c676025c55911027a65f5bba951e40d008066aec034bb108e5c90","observation_id":"a4468ba5-39a4-49b0-9778-870181cf0d07","resolution":{"observed_at":"2026-08-05T14:31:42.908793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:37.084415Z","title":null,"venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.084415Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:19039d3238393e12768d783d7154301e8f5131862a83063236129a23207e0d63","observation_id":"c184507a-1e85-4b33-8a98-74a804bb044f","resolution":{"observed_at":"2026-08-05T14:31:37.084415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.592530Z","title":"Hiriart-Urruty and C","venue":null,"work_id":"cdb41b5e-f4ea-4166-85dc-07561cb45aae","year":2004},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.159941Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2027c63f482dd2c05a8e49ff9e0cb7f7ca9cedb3a7f05c10e2e115426476de58","observation_id":"18d25e0a-98c9-422f-947b-135b42902d99","resolution":{"observed_at":"2026-08-05T14:31:42.707089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.411481Z","title":"Differentiable dynamic programming for structured prediction and attention,","venue":null,"work_id":"a662fe79-d09a-4185-9799-2d3cf76c745a","year":2018},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.237763Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:56751121c3d7a5e9ca25a710662d5d244b558d4fd63baae81e451479ad4f4c42","observation_id":"a55d2cd3-1b4c-4363-89e4-79d9a2276489","resolution":{"observed_at":"2026-08-05T14:31:42.503351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:42.236937Z","title":"Sequential decomposition of sequential dynamic teams: applications to real-time communication and networked control sys- tems,","venue":null,"work_id":"31ae69cb-4a2b-4514-a6e5-c8c2d19e143c","year":2008},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.323069Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:2342c4184d2a39f806084905bd21941d9c50ab384aa28e0447f9bbfa284b1c9c","observation_id":"7cfe5ea7-ef0b-483e-b378-ccb4976e26bd","resolution":{"observed_at":"2026-08-05T14:31:42.331616Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.984739Z","title":"Reinforcement learning with deep energy-based policies,","venue":null,"work_id":"7f725e67-3e3d-4438-bb4e-aa3ff67cb1aa","year":2017},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.412286Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:021a5aa0059c004ea8205ba5adf7b21ad2e42109bfaa328b12299c5aaa64e57d","observation_id":"4de4b806-c3dd-4c6d-9232-57f89e0772f5","resolution":{"observed_at":"2026-08-05T14:31:42.068652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.827457Z","title":"A stochastic approximation method,","venue":null,"work_id":"0b76ce95-aed7-4249-aeb7-fc95f23f6970","year":1951},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.525757Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:05962f8b3e7790b08232c3fef43daef023ae1437fdd5215e1cec4c29ffba0bd0","observation_id":"040ab679-c9b4-4c4e-a0d3-edf9b0ad9552","resolution":{"observed_at":"2026-08-05T14:31:41.902865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.598427Z","title":"Q-learning,","venue":null,"work_id":"b44c6525-dd3f-4534-9c7c-c4b9d98e6983","year":1992},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.615856Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:6592b462edfe64530ebc2bf02e9e10193c65137a68c626c7cce6ae8f2b56bd43","observation_id":"3ab540f2-df98-4d98-92f6-2610b567d596","resolution":{"observed_at":"2026-08-05T14:31:41.716577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.339813Z","title":"Asynchronous stochastic approximation and Q- learning,","venue":null,"work_id":"698bdae9-85d7-49a9-b7d9-1b32ab7c741b","year":1994},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.652967Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:0385c53ef868ae785342cd216ca1aed342b28ac55e786ce4f821cfb1814fe0cc","observation_id":"119f1e27-9cfe-4cb5-b36f-b3e55cf620c2","resolution":{"observed_at":"2026-08-05T14:31:41.485248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:41.076981Z","title":"Learning without state- estimation in partially observable Markovian decision processes,","venue":null,"work_id":"d87309f7-3093-4ecb-a3d1-8ddf0b993429","year":1994},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.681926Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:bb2237a0a9404a1388d98b971c15c5316860cd09e48b0d95f4bf7545ffc77210","observation_id":"59d2640a-5d45-44aa-b9ff-1e4605571daf","resolution":{"observed_at":"2026-08-05T14:31:41.237200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:40.739713Z","title":"Gradient-based algorithms for zeroth- order optimization,","venue":null,"work_id":"d152e9ac-3c46-46ce-958f-0076d81f6cd0","year":2025},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.802366Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d4b49964a2062522b832def1900ebcc7c934cb2687a5c0658db7547907365320","observation_id":"f091b0cf-ee18-4f4a-bb48-fc5ff88244e9","resolution":{"observed_at":"2026-08-05T14:31:40.858054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:40.545691Z","title":"X a∈A πt(a | Zt+1)Qt(Zt+1, a) − Ω(πt(· |Zt+1))− X a∈A π⋆(a | Zt+1)Qµ(Zt+1, a) + Ω(π⋆(· |Zt+1)) # (a) ≤ γ","venue":null,"work_id":"d93e36ee-3004-4202-9bf5-33f076af20fe","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:37.911109Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:d678d923ceb4158c6ee139562d5a16cd8fd052dc62cf1f222d2416d65783b65d","observation_id":"df21a8b9-1592-4b0e-a279-2b28286661cd","resolution":{"observed_at":"2026-08-05T14:31:40.652015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:40.266413Z","title":null,"venue":null,"work_id":"179e52b4-e767-4fc5-8e97-3a015a1f98c0","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.053757Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:a24a1a9b51690e5867bd2ec51f0a9f34d69b4225652c9fbe6ac1e738f85df0eb","observation_id":"8d962d91-cbdd-4605-aec2-ea7843db0b2c","resolution":{"observed_at":"2026-08-05T14:31:40.410414Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:39.871262Z","title":"future states","venue":null,"work_id":"72d20570-901d-47a3-8d73-fab3f31714f6","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.266308Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:6fae5fbb069805f8eaac6bd7604e36f2eaec7b7e79e60afefaf8d179b1aeb505","observation_id":"861e7c8a-51fa-45db-8e7c-2d55f55dcccb","resolution":{"observed_at":"2026-08-05T14:31:40.070206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:39.559899Z","title":"X a∈A πℓ t (a | Zt+1)QJℓ+1K t (Zt+1, a) − Ω(πℓ t (· |Zt+1))− X a∈A πℓ,⋆(a | Zt+1)QJℓ+1K µ (Zt+1, a) + Ω(πℓ,⋆(· |Zt+1)) # (a) ≤ γ","venue":null,"work_id":"72c0de8f-1cac-4d91-a6a1-127017ebf6ff","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.420084Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:7e7d7a1a835e9fc4a0c6d955c5e19a17336e500d0420f844724012124fedf289","observation_id":"c5a98ed7-d2b8-4cf5-b4cb-df55b3d781f7","resolution":{"observed_at":"2026-08-05T14:31:39.710166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:39.297949Z","title":null,"venue":null,"work_id":"64075aec-29bb-451c-8cf2-185a4a9cba1c","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.616959Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:9651ac0c7f10ab685885b93e8564b12c61804d0f0da34c67fdf9d81910795513","observation_id":"8f606a3a-2faf-468d-add3-72e98cb0c788","resolution":{"observed_at":"2026-08-05T14:31:39.414915Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T14:31:38.977038Z","title":"These two cases must be considered separately","venue":null,"work_id":"3ac10830-a616-439b-bdb4-fed82d9d27ce","year":null},"citing_paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-05T14:31:38.795970Z"},"links":{"citing_paper":"/paper/2508.21314"},"observation_digest":"sha256:099954c718b4cc434fe0013d7284aaf6a7e103d7ff3fb95140623e8f77b8b3a1","observation_id":"f9b99d8f-132e-4671-ad10-b449dc842323","resolution":{"observed_at":"2026-08-05T14:31:39.077876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.21314","last_updated":"2025-09-02T23:21:19Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-05T14:31:33.919260Z","submitted_at":"2025-08-29T02:45:28Z","title":"Convergence of regularized agent-state-based Q-learning in POMDPs"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":41},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2508.21314."}