{"as_of":"2026-08-08T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e6cb8daf03c320e33ca712a81b527ca070febb132126a40126a7535cceba68f","coverage":[{"denominator":36,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":36,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:00:50.297031Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.23857/citation-record","integrity":"/paper/2505.23857/integrity","json":"/paper/2505.23857/citation-record.json","paper":"/paper/2505.23857"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:58.153062Z","title":"Outracing champion gran turismo drivers with deep reinforcement learning,","venue":null,"work_id":"ef9e0838-eb2a-48ad-a0c8-568cb0775a42","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:46.693038Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:3fd62599aea59eb2dd6866883fb6b426ef2119af5e32b67109d24a84b0238a90","observation_id":"ee0928d1-5450-4824-8cb1-c4cca182d8af","resolution":{"observed_at":"2026-08-07T13:00:58.276582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.926770Z","title":"Perceiving the world: Question-guided reinforcement learning for text-based games,","venue":null,"work_id":"a9eca632-de15-4206-8aa5-0753cbc23958","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:46.802798Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:95a894c43d6d72e78f0ee5c959b3591ca6dfc6d6e9008f8f38b7c99643f28e02","observation_id":"787d3297-e4d8-4e5d-9163-85c5022bfe9a","resolution":{"observed_at":"2026-08-07T13:00:58.044516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.675523Z","title":"Deep reinforcement learning in health- care and bio-medical applications,","venue":null,"work_id":"0fc0c867-1959-41ef-9f90-ebb139ba22e1","year":2024},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:46.914626Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:e91f8c8b8ecbf93f8aa4c29ab232d464e1e40dfe5a69b95c22e6493b7befbfae","observation_id":"3700d2d0-d447-40bb-8dd9-84e69ec476c8","resolution":{"observed_at":"2026-08-07T13:00:57.782473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.354820Z","title":"Deep reinforcement learning in radiation therapy planning optimization: A comprehensive review,","venue":null,"work_id":"3fb9c9dc-17a4-4ab8-8dbc-a9b445130cfe","year":2024},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.002939Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:167e34beffd8323d123be08ec98e05272488bd0e955b9253b7b176456dea4301","observation_id":"d1f0340e-21e3-4e01-a9cd-875eeb1b51de","resolution":{"observed_at":"2026-08-07T13:00:57.515201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.172598Z","title":"Magnetic control of tokamak plasmas through deep reinforcement learning,","venue":null,"work_id":"10abd658-9b22-4493-bf88-6f8dd0bacc68","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.105465Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:a539b7de78922f8269a4fa085810f5b248fa812db30009e56dd035e7b79d3bb3","observation_id":"e8796b3e-719e-4147-8566-b3f304acd6ff","resolution":{"observed_at":"2026-08-07T13:00:57.214044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:57.001935Z","title":"Reinforcement learning for decision-making and control in power systems,","venue":null,"work_id":"2f7a3c93-e752-4379-b7ea-948a58904200","year":2023},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.192450Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:e84775a6fbb095d1cb422916a992fdbabd2511f93a67ab60a33ff252159d22f0","observation_id":"612b66ac-8085-491b-ab01-7c23a58ebf16","resolution":{"observed_at":"2026-08-07T13:00:57.100933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:56.818936Z","title":"Reinforcement learning with long short-term memory,","venue":null,"work_id":"9fd45b14-f16a-433a-8b9e-117ad390d3a9","year":2001},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.318792Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:1e5c7b2ec2350462d75814dfa5b04caabf654fb18d225dc63ae3b17bc18b4b3f","observation_id":"25134737-fe53-4046-8510-6efc80983b3d","resolution":{"observed_at":"2026-08-07T13:00:56.935703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:56.550735Z","title":"Deep recurrent q-learning for partially observable mdps,","venue":null,"work_id":"a51a1ba1-313c-4226-9e05-eeb12708dc23","year":2015},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.426053Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:34498b8e533328710ff1ab7e1fd63873100a5c98f3c193ef9d9bf4c7c06164b0","observation_id":"1c813bee-709a-4a04-8910-346eda6952fc","resolution":{"observed_at":"2026-08-07T13:00:56.671191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:56.356548Z","title":"Attention is all you need,","venue":null,"work_id":"3e37343c-42c9-4008-862c-a9a9a5246ef5","year":2017},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.548687Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:c22589139ce86792c0f6877525bda98c54995560b8f7c8c7f215016630cad578","observation_id":"f9a1636e-1115-4150-b901-67b8c5bc996d","resolution":{"observed_at":"2026-08-07T13:00:56.482078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:56.088626Z","title":"Decision transformer: Reinforcement learning via sequence modeling,","venue":null,"work_id":"6f98cc98-7ec8-4a17-9031-b6fa17577c14","year":2021},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.679746Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:7ca329320e7b244d8873bdbd69ed9f4f27ee5fa7b2c387b0b31dde44a725d40a","observation_id":"93c61bfe-d5f4-4e00-8e33-ebfe93463c0d","resolution":{"observed_at":"2026-08-07T13:00:56.202824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:55.848178Z","title":"Online decision transformer,","venue":null,"work_id":"cf519aea-4f9c-475d-a028-6c8c00b616df","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.813180Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:08407fd86a46bbe027cf25cf8d37618dbac8a3011030bfa7e9759fd8b7df3c93","observation_id":"1def55a1-4992-4de2-a9af-c0b7aab7be50","resolution":{"observed_at":"2026-08-07T13:00:55.971803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:55.542009Z","title":"Trajectory transformer: Model-based reinforcement learning with long-term dependencies,","venue":null,"work_id":"b8605841-e6d0-40aa-a127-7f57440203ec","year":2021},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:47.930098Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:957406bb31b3c7317c77724f58c4d8330f74e1fbf7a968a14fc517c09488ddb0","observation_id":"06446c79-5413-42ee-a72e-54df07bcc829","resolution":{"observed_at":"2026-08-07T13:00:55.676674Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:55.245540Z","title":"Optimal control of markov processes with incomplete state information,","venue":null,"work_id":"379c5ac5-f290-4c3f-851c-03bacd6fdf08","year":1965},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.023453Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:b357994aafac3e7e9bcc427675e26bebcb45615c039118c9d65efaa868f333e1","observation_id":"06ed75b3-7397-4c66-b1a0-905fdb64cad9","resolution":{"observed_at":"2026-08-07T13:00:55.408801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:54.970216Z","title":"Multi- agent rollout and policy iteration for pomdp with application to multi- robot repair problems,","venue":null,"work_id":"496c145c-d25a-4489-8d68-ab22f2a79eb3","year":2020},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.117648Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:181eb7b85703fcc1f27887665cef9a3d77211d0ab138b2fc9c87da7e4e30afb8","observation_id":"a416ac10-d75e-4701-9591-b4d99b42f385","resolution":{"observed_at":"2026-08-07T13:00:55.081488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:54.658316Z","title":"Controlling contact-rich manipulation under partial observability,","venue":null,"work_id":"e2fb9ad2-3553-4d9a-beae-88e4d277e843","year":2020},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.245135Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:32c60d0b009fcc749a880875728bb4ef199ac47dee3dbc5695b5c5826484ee67","observation_id":"980d06a0-93f1-46b0-8080-a46c11894433","resolution":{"observed_at":"2026-08-07T13:00:54.827760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:54.404958Z","title":"Magic: Learning macro-actions for online pomdp planning,","venue":null,"work_id":"ce47ecc9-c2da-4f8d-b387-a8627612b0be","year":2021},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.364342Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:dfedbf7fc977c901551e3e5a4394a8c07700f11806ac1421810c9d752f1d5802","observation_id":"1ac0fda2-bb84-4d20-b8f2-ca37bfe00c90","resolution":{"observed_at":"2026-08-07T13:00:54.530242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:54.108541Z","title":"Optimizing active surveil- lance for prostate cancer using partially observable markov decision processes,","venue":null,"work_id":"dbf2489c-2560-479e-90c8-b550f5b605f8","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.451457Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:e8f0d3d463ed929ed979c63938efde17d4fb7efee5b05b441015d7d819b0cf83","observation_id":"1ac94790-f526-4394-b40d-b91cc5ab4816","resolution":{"observed_at":"2026-08-07T13:00:54.272813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:53.889566Z","title":"Diagnostic policies optimization for chronic diseases based on pomdp model,","venue":null,"work_id":"02a198d0-aade-4319-8395-4a602ea02fd3","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.549375Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:b3d06ef33d74c902fc34ddcc50fed18191f7b252612995c3918b0f23b8d14306","observation_id":"82fe0bda-cff5-44d2-a44b-57e113b991b6","resolution":{"observed_at":"2026-08-07T13:00:53.980464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:48.673350Z","title":"Planning and acting in partially observable stochastic domains,","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.673350Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:834d9d979fabdb038b97fdc1d79817146666fd42c0a82bd521eebfc4ecdbe0a2","observation_id":"a9cf74e5-acff-4bfd-9039-d452f373a715","resolution":{"observed_at":"2026-08-07T13:00:48.673350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:48.767588Z","title":"Finding structure in time,","venue":null,"work_id":null,"year":1990},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.767588Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:6ae8809d17017f226085c8ea2601a624ca8e4de60d6e12afe7f98e352835b447","observation_id":"03faa789-ee6f-412e-8ece-635e2626ae33","resolution":{"observed_at":"2026-08-07T13:00:48.767588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.06527","last_updated":"2017-01-11T20:25:54Z","snapshot_observed_at":"2026-08-03T18:25:04.868564Z","submitted_at":"2015-07-23T15:16:46Z","title":"Deep Recurrent Q-Learning for Partially Observable MDPs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.06527","snapshot_observed_at":"2026-08-07T13:00:48.834145Z","title":"Deep recurrent q-learning for partially observable mdps,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.834145Z"},"links":{"cited_paper":"/paper/1507.06527","citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:f21ff06ce963ee106dbce93a66c99bdd78d8dba2b7e0149cd1e0573ee597e2c0","observation_id":"c026bac9-5a73-4688-b88d-2ccd7dc3ea67","resolution":{"observed_at":"2026-08-07T13:00:48.834145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:48.927033Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:48.927033Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:44a1b7e0683dcec42ac92e8099f4a2b0391205eb0e331e18e18e08eb5a1866f1","observation_id":"3f246ff6-32ab-4de7-b26f-cc04966336d6","resolution":{"observed_at":"2026-08-07T13:00:48.927033Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:49.028677Z","title":"Human-level control through deep reinforcement learning,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.028677Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:e3022fec20c051f5d1c6e557a923400cdc4e6607c254e2abc69083e8c504705d","observation_id":"1158ee86-f78e-4150-b2d9-c65ef2d035bf","resolution":{"observed_at":"2026-08-07T13:00:49.028677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:53.623018Z","title":"Recurrent determin- istic policy gradient method for bipedal locomotion on rough terrain challenge,","venue":null,"work_id":"14f61b2b-71ce-480e-9a75-6f0d051431d0","year":2018},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.133496Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:5bda0d9b524ac6ed26a2607d8fd96c3b72a4df2519b0fcb9f6a3bb4ddae3db36","observation_id":"fd299bc2-33a4-4dbd-b520-42e05fef0675","resolution":{"observed_at":"2026-08-07T13:00:53.738085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:53.366661Z","title":"Recurrent soft actor critic reinforcement learning for demand response problems,","venue":null,"work_id":"a8e83950-3832-4718-aa0c-5a46ab105c97","year":2023},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.253527Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:4561883317b124af408b09236d70d46e91d958452be8117fa4edb7edaf8cad61","observation_id":"25cf2b11-0e80-4300-be83-112202c4cea7","resolution":{"observed_at":"2026-08-07T13:00:53.499128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:52.421994Z","title":"Memory-based deep reinforcement learning for pomdps,","venue":null,"work_id":"7ac29877-556e-4d6d-935f-86b4edb066db","year":2021},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.325360Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:17c9dd0b0e1d3cc0cfdbf35b6b0e3cfebf612b00593b3435ea0eabe809397ed7","observation_id":"8dc248fd-84b5-4920-a38b-e5e51796b581","resolution":{"observed_at":"2026-08-07T13:00:52.965017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:51.991658Z","title":"Addressing function ap- proximation error in actor-critic methods,","venue":null,"work_id":"47393ed5-11fe-4af3-8b50-53c221d5f718","year":2018},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.382397Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:c4abfc29a5da9fdc3d1ba774098ffa502ec2f5e8288e80f7c54c6898afbcba60","observation_id":"e5e61561-e27a-45bb-82a2-7cdd380b3d24","resolution":{"observed_at":"2026-08-07T13:00:52.114131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:51.778459Z","title":"Recurrent model-free RL can be a strong baseline for many POMDPs,","venue":null,"work_id":"f960a464-01fd-4b20-a785-a18f684d5f99","year":2022},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.445900Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:5c8cbe2a485fa5727b77ed0c267962e60bb4c2910667d323548a4699ab4f5650","observation_id":"d87b4ba8-4666-4b32-9376-d4908df20c88","resolution":{"observed_at":"2026-08-07T13:00:51.891029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:51.551318Z","title":"Ode-based recurrent model-free reinforcement learning for pomdps,","venue":null,"work_id":"720e8296-461a-4053-b315-a24d28c2c50c","year":2023},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.540563Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:db4ad7e12b8a093b4bc8411da88340b4500ad92c1c4799c63d09061661292242","observation_id":"e8aa4f39-2325-4c08-a84a-14c8350b98b1","resolution":{"observed_at":"2026-08-07T13:00:51.663513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:51.363227Z","title":"Efficient recurrent off-policy rl requires a context-encoder-specific learning rate,","venue":null,"work_id":"612f8239-ecfd-434c-b0ad-99a7a776e113","year":2024},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.615798Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:ed4ac4437d3134427f12c43608c1a30cb1ffd1f0683bafd21a50e6dc83f190a8","observation_id":"5885b47e-04a4-4382-b76e-44fe516dc020","resolution":{"observed_at":"2026-08-07T13:00:51.428197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:51.167236Z","title":"The moving horizon estimation concept,","venue":null,"work_id":"f0ea5988-f01a-4140-a827-4e123240896e","year":1990},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.721558Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:6f0b58ca83dc84b4c4292a8773927f1c1f800932f33b9f74a61d80955cebabc5","observation_id":"94bc0942-4711-4676-ab77-67e683241ee3","resolution":{"observed_at":"2026-08-07T13:00:51.257691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:49.828362Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.828362Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:fbe481bd01d4d7d9c35628a44e8f6780db6749b36333fe7067d4736bd70c45e9","observation_id":"0eb34a92-e2a9-43e5-bfe7-c90ad9d335c2","resolution":{"observed_at":"2026-08-07T13:00:49.828362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:50.940444Z","title":"Xception: Deep learning with depthwise separable con- volutions,","venue":null,"work_id":"78f409d8-11a0-456e-b882-c4a11349bf33","year":2017},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:49.941340Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:a5c78a0b054de80c7e5ee1c4167757930b9d40f9d410623cc2a00eb2147fe080","observation_id":"bade8861-cc21-45c7-b86a-e1fed2ee2fb5","resolution":{"observed_at":"2026-08-07T13:00:51.044199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:50.678834Z","title":"Thin mobilenet: An enhanced mobilenet architecture,","venue":null,"work_id":"24705806-d965-4112-933e-cbd49e87f2b0","year":2019},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:50.078357Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:0dfce43bc4525988ba72ad8b34a66921bb0ba2222c4c1fa9cf5548b71fd26ec9","observation_id":"a175d284-c13c-4de4-a929-76aa000de7b5","resolution":{"observed_at":"2026-08-07T13:00:50.809998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:50.450669Z","title":"Gymnasium,","venue":null,"work_id":"28905ebc-269a-4e53-82a6-80ec06c66831","year":2023},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:50.191643Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:5636f33fb5be025d3fa163e21bc8c56fa1b1dce0465db42ab11cca19e045da56","observation_id":"7864e1a8-ca95-400d-81fe-c7983382935d","resolution":{"observed_at":"2026-08-07T13:00:50.549173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T13:00:50.297031Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T13:00:50.297031Z"},"links":{"citing_paper":"/paper/2505.23857"},"observation_digest":"sha256:fcddc037faab4f0d6ae6115c96d0931a134b195e102cee820bd0bb91d2368035","observation_id":"5462c8ff-cf8e-477c-852e-295f4576d4e3","resolution":{"observed_at":"2026-08-07T13:00:50.297031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.23857","last_updated":"2025-09-13T03:54:46Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T12:50:23.387036Z","submitted_at":"2025-05-29T06:22:06Z","title":"A Convolution and Attention Based Encoder for Reinforcement Learning under Partial Observability"},"reference_resolution":{"displayed":36,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":7,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":36},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 36 of 36 outbound references and 0 inbound Pith citation observations for arXiv:2505.23857."}