{"as_of":"2026-08-17T19:48:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48137287bd41d5cede45e9006dcf139f49dd6f23a5dd794f20feb01d222f07e3","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:01:22.868400Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11153/citation-record","integrity":"/paper/2505.11153/integrity","json":"/paper/2505.11153/citation-record.json","paper":"/paper/2505.11153"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.701548Z","title":"Reinforcement learning in game industry—review, prospects and challenges,","venue":null,"work_id":"7357c619-80af-4021-9eca-f89559adcaea","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.596392Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:23de0444f70158b4108bdbe030f0f4dbc1a65e14857125dc7fa88ea5b61a54e2","observation_id":"1868bd64-3169-486a-ac63-7bef0f6ee600","resolution":{"observed_at":"2026-08-15T21:01:23.706877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.601706Z","title":"Artificial intelligence, machine learning and deep learning in advanced robotics, a review,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.601706Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:e9c64523ddaefd043fc02477e7551d6d7ca2afb26edd187c6994cb3f564af0b0","observation_id":"5b36d62b-6933-4947-ad82-0c273075a833","resolution":{"observed_at":"2026-08-15T21:01:22.601706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.5602","last_updated":"2013-12-19T16:00:08Z","snapshot_observed_at":"2026-08-17T17:19:33.060917Z","submitted_at":"2013-12-19T16:00:08Z","title":"Playing Atari with Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.5602","snapshot_observed_at":"2026-08-15T21:01:22.606744Z","title":"Playing atari with deep reinforcement learning,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.606744Z"},"links":{"cited_paper":"/paper/1312.5602","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:ff7802f5a1cdddda958c92ca35175fd65e12b2eff5a4663343bd8f5b833ab08f","observation_id":"afb15a91-ee65-49f1-81ff-92498e50dd95","resolution":{"observed_at":"2026-08-15T21:01:22.606744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.678065Z","title":"Weakly coupled deep q-networks,","venue":null,"work_id":"3fe0384c-210e-47f8-9267-2c0281d9dfe9","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.611371Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:37464ba2d2382cbbe420ec0182bbd6bf869bf093b58847c80e0bd79a078f0363","observation_id":"f0d16ee2-0918-4a41-9bc0-b48eeb8b0c50","resolution":{"observed_at":"2026-08-15T21:01:23.682572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.664085Z","title":"Tuning apex dqn: A reinforcement learning based deep q-network algorithm,","venue":null,"work_id":"e14af9c4-baab-49b8-aac2-141970e460c2","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.616440Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:aa8f70d6423a0b2c20600fb1be88cfa440b78a1988926f43d59c9a1f85b9b6b0","observation_id":"2ca25150-c058-45a0-950c-fe3891c86abf","resolution":{"observed_at":"2026-08-15T21:01:23.668685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.650532Z","title":"Safe reinforcement learning via shielding under partial observability,","venue":null,"work_id":"2c1b15e9-9598-408f-b092-b78aa1150838","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.620781Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:cd305665acf8ba7199d0f5039bf654ec6962e1286903753a9517fa39d420c9eb","observation_id":"0e111d3c-b700-45ee-8af1-df7aa143c6ae","resolution":{"observed_at":"2026-08-15T21:01:23.654874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.637011Z","title":"Integrated task and motion planning for safe legged navigation in partially observable environments,","venue":null,"work_id":"89231479-d552-43b1-bb42-5cf88b9a0cf1","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.625634Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:0450a994fa4200a1df4f30c8bd6fec00436dfd0af4d0857927122db4e7721c8f","observation_id":"c0c88722-5cad-4be5-be71-14d9dad8da2e","resolution":{"observed_at":"2026-08-15T21:01:23.641601Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.629718Z","title":"Deep reinforcement learning for multiagent systems: A review of challenges, solutions, and applications,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.629718Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:f5311eb31475dfc5403f298f85da4c776a115cddd5b30ae6ff527375063f55f7","observation_id":"2a3f48f8-7f06-47b2-a650-a797f9fb2ba3","resolution":{"observed_at":"2026-08-15T21:01:22.629718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.633844Z","title":"A definition of continual reinforcement learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.633844Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:ae673997de3e7245d742a6fdf928a044d618e019fa3d078f90fec42c01d8ccc3","observation_id":"95640671-922e-4ad1-b63e-a3f8ee8426f4","resolution":{"observed_at":"2026-08-15T21:01:22.633844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.605908Z","title":"Deep reinforcement learning unleashing the power of ai in decision-making,","venue":null,"work_id":"ed3f9b4d-9204-4301-a972-2de1703bb8fe","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.638178Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9aed6fba823e47931b561499e8f8520534ea1c1ca49fef696071227fad34fe0e","observation_id":"0d9b6466-e0f7-4ed8-a408-370001b6650b","resolution":{"observed_at":"2026-08-15T21:01:23.610494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.642683Z","title":"Exploration in deep reinforcement learning: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.642683Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:484cf2f897e59c4f5970397ad6144fc89e2bb693db57e5a74c434ec48d8fbb4c","observation_id":"b554e27a-280c-45c4-89ba-5f6b8de6cda1","resolution":{"observed_at":"2026-08-15T21:01:22.642683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.646843Z","title":"Memory gym: Partially observable challenges to memory-based agents,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.646843Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:e1f51c40ddfed66aad96f6578598b289a33c8712f054d1dbb4258e2d072fe556","observation_id":"ca5fec4b-57dc-47e4-bf84-fa36857fee63","resolution":{"observed_at":"2026-08-15T21:01:22.646843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.574654Z","title":"Deep rein- forcement learning: A survey,","venue":null,"work_id":"df009d18-cd49-4c10-bcc6-ac047509fb35","year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.655825Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:b998584db934a4b5a452d464842a82aecd55a5bf09017c9ebc078dde797353f6","observation_id":"0657da13-58f0-4684-8e76-e35f23d2df8e","resolution":{"observed_at":"2026-08-15T21:01:23.579178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07599","last_updated":"2021-07-15T20:38:22Z","snapshot_observed_at":"2026-08-17T08:10:27.884796Z","submitted_at":"2021-07-15T20:38:22Z","title":"Partially Observable Markov Decision Processes (POMDPs) and Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.07599","snapshot_observed_at":"2026-08-15T21:01:22.659923Z","title":"Partially observable markov decision processes (pomdps) and robotics,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.659923Z"},"links":{"cited_paper":"/paper/2107.07599","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:336457e03f984cb7aead37bf80302895cc226cfa170040c1f2dd27b277112719","observation_id":"5f247310-6da1-4525-b271-3e4b7100aa90","resolution":{"observed_at":"2026-08-15T21:01:22.659923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.560722Z","title":"Recurrent neural networks,","venue":null,"work_id":"d5f52356-b559-4b1d-8787-a73ed1d159f3","year":2001},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.664501Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:2ada278786cf92bc77d588960f49d0d4600a5cc9422be007c30bef894a1ff57a","observation_id":"179ec413-502f-4197-b9b0-e231b42dee0c","resolution":{"observed_at":"2026-08-15T21:01:23.565191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.669081Z","title":"Long short-term memory,","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.669081Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1d6c2c7734a98827ad17f97cec0e63bdcee2c364cd4914937cf84337cfbe475c","observation_id":"5508d405-6ba2-44ff-a703-bd4ae0ce2130","resolution":{"observed_at":"2026-08-15T21:01:22.669081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.538772Z","title":"Gate-variants of gated recurrent unit (gru) neural networks,","venue":null,"work_id":"f22102d1-8a9c-4cbd-ab21-2bbb4645742e","year":2017},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.673326Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1b4ef080936ccdfef74b70df4a79c816dee25b6c53bbd6bfd0d09539e41bad2b","observation_id":"6c3462ee-db52-4081-a500-2e68d82f52db","resolution":{"observed_at":"2026-08-15T21:01:23.543519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.524642Z","title":"Recurrent prediction model for partially observable mdps,","venue":null,"work_id":"d19cb94b-15da-4128-ba0d-4837924f3564","year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.677802Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:5ac5adc3e465d678f2183530bc258bdc913a0879138e9118736ce0ab5fae9d91","observation_id":"70c446ac-4926-4f2c-9ad1-327e144ea182","resolution":{"observed_at":"2026-08-15T21:01:23.529450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.509825Z","title":"Visualizing transformers for nlp: a brief survey,","venue":null,"work_id":"cfe3c9a7-9789-49ab-8818-58f02f8917d4","year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.682088Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:56ceb3a10c1452a0c163bc62060189a066c0e600d225ec6ada949e675660348b","observation_id":"ef5001db-3314-4c8c-b216-d89e3637eeda","resolution":{"observed_at":"2026-08-15T21:01:23.514757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:22.686804Z","title":"Transformers in vision: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.686804Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:5d68af04050ac8e2a16e90c4929c16005da3bd6410dd273a9c9201ee4cde7ed2","observation_id":"c37841f9-3099-4022-80b6-56f081478351","resolution":{"observed_at":"2026-08-15T21:01:22.686804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.486204Z","title":"Windows deep transformer q-networks: an extended variance reduction architecture for partially observable reinforcement learning,","venue":null,"work_id":"fba2fc84-3e59-48e9-9ad7-454c49401e86","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.691129Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:247bafed368ca76508b51032cd0e5918a5a6a54c739ba828f7a8af5f995dd661","observation_id":"cc20339b-6200-4c54-9e2d-9b4618c91561","resolution":{"observed_at":"2026-08-15T21:01:23.490794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01078","last_updated":"2022-11-10T15:04:36Z","snapshot_observed_at":"2026-08-16T16:55:44.376504Z","submitted_at":"2022-06-02T15:04:18Z","title":"Deep Transformer Q-Networks for Partially Observable Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.01078","snapshot_observed_at":"2026-08-15T21:01:22.695510Z","title":"Deep transformer q-networks for partially observable reinforcement learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.695510Z"},"links":{"cited_paper":"/paper/2206.01078","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:197e9953ace4c77c61346eb84905b3ddc18e43addfb8e7b5ff7c59be02270a7e","observation_id":"c391dc60-aab2-49e3-89ab-0fe39343235a","resolution":{"observed_at":"2026-08-15T21:01:22.695510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1507.06527","last_updated":"2017-01-11T20:25:54Z","snapshot_observed_at":"2026-08-17T11:39:27.847807Z","submitted_at":"2015-07-23T15:16:46Z","title":"Deep Recurrent Q-Learning for Partially Observable MDPs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1507.06527","snapshot_observed_at":"2026-08-15T21:01:22.701126Z","title":"Deep recurrent q-learning for partially observable mdps,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.701126Z"},"links":{"cited_paper":"/paper/1507.06527","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:a927a2ee44cf4526b17971b8f0de75a90ec35075bb82f62d1b53300540a08706","observation_id":"3888cc66-5364-4345-93f6-9de049e8a60e","resolution":{"observed_at":"2026-08-15T21:01:22.701126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.472057Z","title":"On improving deep reinforcement learning for pomdps,","venue":null,"work_id":"2cfcbc3d-c944-4fe9-a702-bd91e9960e44","year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.705893Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:97a23d399729ef5e16892843cdd8a54803715f57571857cf0154daaab151603a","observation_id":"72a74ba4-3b51-48b8-be89-0bedcb1171fc","resolution":{"observed_at":"2026-08-15T21:01:23.476678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02672","last_updated":"2016-02-08T18:01:35Z","snapshot_observed_at":"2026-08-14T22:11:12.682186Z","submitted_at":"2016-02-08T18:01:35Z","title":"Learning to Communicate to Solve Riddles with Deep Distributed Recurrent Q-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1602.02672","snapshot_observed_at":"2026-08-15T21:01:22.714601Z","title":"Learning to communicate to solve riddles with deep distributed recurrent q-networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.714601Z"},"links":{"cited_paper":"/paper/1602.02672","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:95245fef25eb1e85bed68532e5185403db8d1d22cd944ec2f1858baf0311e36f","observation_id":"46461b7f-00a1-4fad-b3cd-85734e91a628","resolution":{"observed_at":"2026-08-15T21:01:22.714601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.458936Z","title":"Deep reinforcement learning with bidirectional recurrent neural networks for dynamic spectrum access,","venue":null,"work_id":"9366df1d-fa93-4b43-8304-ecd2108f87b2","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.719144Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:d61d4d9a0cfad716d3e070e58dc9bb03f745e36ee8228f3de6850557a73f4647","observation_id":"bf1657e5-c0f3-4a7c-b00d-852e039ba788","resolution":{"observed_at":"2026-08-15T21:01:23.463274Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.445928Z","title":"On transforming reinforcement learning with transformers: The development trajectory,","venue":null,"work_id":"55cc3de7-94a8-422e-9992-a5f32f939983","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.723470Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:686b34da3e363298f045bba4e4d1602b1b450524278fa1a9a0d033a88bd2b629","observation_id":"ae84f17b-566d-4557-b30f-08976440d674","resolution":{"observed_at":"2026-08-15T21:01:23.450134Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.432672Z","title":"Transformer in reinforcement learning for decision-making: A survey,","venue":null,"work_id":"88f9ed82-0def-4962-9af5-d8d9bca33f13","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.727574Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:5b92dcd8b97ef678708548200fbf0a4e487e567d154e7bbfda39fda6bd3234b3","observation_id":"a562b3df-f1db-4c05-8ff3-3066d67b3fb7","resolution":{"observed_at":"2026-08-15T21:01:23.437267Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-17T01:19:18.409791Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T21:01:22.731661Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.731661Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:4224f117a45715622f27cae2709fb39bf8ffd6d9c2a77b090ab554b548c21ec8","observation_id":"bc4f5edf-f3a8-418b-9dd3-a8428fb3d894","resolution":{"observed_at":"2026-08-15T21:01:22.731661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.01345","last_updated":"2021-06-24T17:09:59Z","snapshot_observed_at":"2026-08-14T21:45:36.706364Z","submitted_at":"2021-06-02T17:53:39Z","title":"Decision Transformer: Reinforcement Learning via Sequence Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.01345","snapshot_observed_at":"2026-08-15T21:01:22.735633Z","title":"Decision transformer: Reinforcement learning via sequence modeling,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.735633Z"},"links":{"cited_paper":"/paper/2106.01345","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:104a6cd48b37be2c4d81b189f7ee6540a62dac09eb0443f19b9d8cb19e0935ac","observation_id":"dc739bf0-97d2-4002-b7ab-733b2d16428b","resolution":{"observed_at":"2026-08-15T21:01:22.735633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1512.01693","last_updated":"2015-12-05T18:35:40Z","snapshot_observed_at":"2026-08-16T13:29:09.270308Z","submitted_at":"2015-12-05T18:35:40Z","title":"Deep Attention Recurrent Q-Network","version":1},"cited_work":{"arxiv_id":"1512.01693","doi":null,"metadata_source":"pith","pith_arxiv_id":"1512.01693","snapshot_observed_at":"2026-08-15T21:01:23.163920Z","title":"Deep Attention Recurrent Q-Network","venue":"cs.LG","work_id":"ba10646c-0314-4b69-af68-088078a2c420","year":2015},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.739898Z"},"links":{"cited_paper":"/paper/1512.01693","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:f979eb083d4a744a8fff552718e0cf12824a846860d12e49490a2b02b606d40d","observation_id":"4cb33299-03b4-4e57-a132-5d852f3352db","resolution":{"observed_at":"2026-08-15T21:01:23.170540Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02500","last_updated":"2019-06-06T10:02:52Z","snapshot_observed_at":"2026-08-14T16:19:57.327249Z","submitted_at":"2019-06-06T10:02:52Z","title":"Towards Interpretable Reinforcement Learning Using Attention Augmented Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02500","snapshot_observed_at":"2026-08-15T21:01:22.744141Z","title":"Towards interpretable reinforcement learning using attention augmented agents,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.744141Z"},"links":{"cited_paper":"/paper/1906.02500","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:8d30502dad2eae00104631fcc2ff05ccd727344cd3fbd1d48076be226f89b10e","observation_id":"bdde2bf2-25da-4f13-825a-1a06159bdf88","resolution":{"observed_at":"2026-08-15T21:01:22.744141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01655","last_updated":"2021-04-04T17:56:34Z","snapshot_observed_at":"2026-08-16T18:33:58.039229Z","submitted_at":"2021-04-04T17:56:34Z","title":"Efficient Transformers in Reinforcement Learning using Actor-Learner Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01655","snapshot_observed_at":"2026-08-15T21:01:22.748705Z","title":"Efficient transformers in reinforcement learning using actor-learner distillation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.748705Z"},"links":{"cited_paper":"/paper/2104.01655","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:0d253148cdbe6a7facdc1314dfce613ad8fa0da833684e2f85f48379804e532f","observation_id":"15e4264b-f93a-4ea3-9c95-268ffa9b797b","resolution":{"observed_at":"2026-08-15T21:01:22.748705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T05:45:01.798828Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-15T21:01:22.753113Z","title":"Gated linear attention transformers with hardware-efficient training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.753113Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:4510a797729d5cb5854db6e18e71cfbb6b76ecd128129eb6d20c3237b0cd556e","observation_id":"c8c00b89-1879-40dc-97da-39507316d0b6","resolution":{"observed_at":"2026-08-15T21:01:22.753113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.418195Z","title":"Offline reinforcement learning as one big sequence modeling problem,","venue":null,"work_id":"3ba46258-4513-47bb-a559-36581783385b","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.757384Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:a6a5a682354bd5bff53f166ddb90d2bf87ee868ed4908f929afe0d128719fa04","observation_id":"95495ef3-5df6-49fb-82f3-4c1d5f2e8526","resolution":{"observed_at":"2026-08-15T21:01:23.422707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05607","last_updated":"2022-07-13T04:21:26Z","snapshot_observed_at":"2026-08-16T17:22:00.419954Z","submitted_at":"2022-02-11T13:43:24Z","title":"Online Decision Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05607","snapshot_observed_at":"2026-08-15T21:01:22.761745Z","title":"Online decision transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.761745Z"},"links":{"cited_paper":"/paper/2202.05607","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:fa82ed349f2c2bbe0a073af3a614a04802fe5f80e524be6d9bec05a526dcae2e","observation_id":"cf540214-cd83-474a-abbf-f3ea2833c154","resolution":{"observed_at":"2026-08-15T21:01:22.761745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03982","last_updated":"2023-11-23T16:02:22Z","snapshot_observed_at":"2026-08-16T15:50:06.398789Z","submitted_at":"2023-03-07T15:32:18Z","title":"Structured State Space Models for In-Context Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03982","snapshot_observed_at":"2026-08-15T21:01:22.766001Z","title":"Structured state space models for in-context reinforcement learning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.766001Z"},"links":{"cited_paper":"/paper/2303.03982","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:768627266b0647a1350dbcb1e72d80de5649e2d51660a31d84cbfdc059be2daf","observation_id":"1d2e5ca5-fe82-49a4-ab95-acd8ef48894f","resolution":{"observed_at":"2026-08-15T21:01:22.766001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04253","last_updated":"2024-03-07T06:35:59Z","snapshot_observed_at":"2026-08-16T14:12:04.670279Z","submitted_at":"2024-03-07T06:35:59Z","title":"Mastering Memory Tasks with World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04253","snapshot_observed_at":"2026-08-15T21:01:22.770341Z","title":"Mastering memory tasks with world models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.770341Z"},"links":{"cited_paper":"/paper/2403.04253","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:533497bf9c816023493c01b677fbef14a9962362bc44f4c1951c272290ebbff1","observation_id":"9266ec07-5a79-46c4-9b8d-d0c3732ee6af","resolution":{"observed_at":"2026-08-15T21:01:22.770341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.403674Z","title":"Mastering atari with discrete world models,","venue":null,"work_id":"f754141c-6484-4717-bcb9-b213bccb4638","year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.774501Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:3172a747e3c38aff8b74678c20d785b5e8692292cae6c579a3ac088716358db4","observation_id":"53be7564-2bce-4acd-a07d-f7e7840a8e45","resolution":{"observed_at":"2026-08-15T21:01:23.408184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16236","last_updated":"2020-08-31T11:09:32Z","snapshot_observed_at":"2026-08-06T23:24:28.908251Z","submitted_at":"2020-06-29T17:55:38Z","title":"Transformers are RNNs: Fast Autoregressive Transformers with Linear Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16236","snapshot_observed_at":"2026-08-15T21:01:22.783296Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.783296Z"},"links":{"cited_paper":"/paper/2006.16236","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:52d1b88beb079669287a69e379059bb0ccbec9f28f8524616aebb198610f472a","observation_id":"95412e92-4c5f-4e87-961d-c47b4c45e61f","resolution":{"observed_at":"2026-08-15T21:01:22.783296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-15T21:01:22.787610Z","title":"Rwkv: Reinventing rnns for the transformer era,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.787610Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1e58b3d5a68e7f9e57c1ced30224ecdbecae56ca99f5c382e93090146feea3e0","observation_id":"1fb5fdc0-918f-403d-803b-cb9169442c2c","resolution":{"observed_at":"2026-08-15T21:01:22.787610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06349","last_updated":"2023-03-11T08:53:11Z","snapshot_observed_at":"2026-08-16T15:49:03.576715Z","submitted_at":"2023-03-11T08:53:11Z","title":"Resurrecting Recurrent Neural Networks for Long Sequences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06349","snapshot_observed_at":"2026-08-15T21:01:22.792509Z","title":"Resurrecting recurrent neural networks for long sequences,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.792509Z"},"links":{"cited_paper":"/paper/2303.06349","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:c0c2fc05bc75b5fe5531685adf5d3ca9e7de498f21df5878836c428207801bc0","observation_id":"c4b344d7-2a02-4d2c-8cbe-5b654b71387a","resolution":{"observed_at":"2026-08-15T21:01:22.792509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.389532Z","title":"Efficiently modeling long sequences with structured state spaces,","venue":null,"work_id":"f17ff5fd-c28a-4359-8bba-00dda42181f1","year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.797991Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:0ee1102271a11562ba5271f6da6f1e596ef1d6944ac40ebfb2563a10d48c2cf5","observation_id":"16c939f0-da6f-4dd8-88c1-87f85629d068","resolution":{"observed_at":"2026-08-15T21:01:23.394090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.04933","last_updated":"2023-03-03T18:35:28Z","snapshot_observed_at":"2026-08-13T08:14:01.416880Z","submitted_at":"2022-08-09T17:57:43Z","title":"Simplified State Space Layers for Sequence Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.04933","snapshot_observed_at":"2026-08-15T21:01:22.806620Z","title":"Simplified state space layers for sequence modeling,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.806620Z"},"links":{"cited_paper":"/paper/2208.04933","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1014d5aca35c75e4cd4aca356e38e850a4427dd9055d624f8d25dd8880580686","observation_id":"fec57d69-189a-4b98-b57d-14c3d8f1049d","resolution":{"observed_at":"2026-08-15T21:01:22.806620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-17T05:48:50.270608Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-15T21:01:22.811361Z","title":"Reinforcement learning upside down: Don’t predict rewards – just map them to actions,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.811361Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:6480ec909ef7cb43744af2ae4059c45760cdb75cdaa478743d4b07c2eb3fee9f","observation_id":"28bbaeba-5c66-4e6f-9f28-eae008db609f","resolution":{"observed_at":"2026-08-15T21:01:22.811361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-15T21:01:22.802215Z","title":"Available: https://arxiv.org/abs/2111.00396","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.802215Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:28c8e9e192f8d2b9c9f1a5eda5c6434639ed2fb5bc482b74b975173d068d293b","observation_id":"30d1836c-1d8b-4175-bf0b-aa61e69e536f","resolution":{"observed_at":"2026-08-15T21:01:22.802215Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-15T21:01:22.820257Z","title":"Longformer: The long-document transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.820257Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:1fb8459c148ed0a73a6563cb8003a9b8394ffa2d4581acaca8c003de4a5e5131","observation_id":"97ea078e-db2f-4e07-a3f1-83beccc4c463","resolution":{"observed_at":"2026-08-15T21:01:22.820257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.375911Z","title":"Transformer-XL: Attentive language models beyond a fixed-length context,","venue":null,"work_id":"a7116abd-c1b1-4dc9-968f-01385af6ff01","year":2019},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.824663Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:a00069251a004f7ed4b2b346b3bafb1af4df4e326489ffb8fb85bbb126dff64d","observation_id":"83ca39f0-2267-4829-b533-4e45e76c6fca","resolution":{"observed_at":"2026-08-15T21:01:23.380533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.06764","last_updated":"2019-10-13T20:02:15Z","snapshot_observed_at":"2026-08-15T16:01:17.783695Z","submitted_at":"2019-10-13T20:02:15Z","title":"Stabilizing Transformers for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.06764","snapshot_observed_at":"2026-08-15T21:01:22.815814Z","title":"Stabilizing transformers for reinforcement learning,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.815814Z"},"links":{"cited_paper":"/paper/1910.06764","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:e382bf3eb1c9bd0192bd1f40f40db372fa22686bde9a71ed766359a83fce1454","observation_id":"1e28d407-380d-484e-9aca-ba9d95119dfe","resolution":{"observed_at":"2026-08-15T21:01:22.815814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.06881","last_updated":"2022-12-08T12:34:16Z","snapshot_observed_at":"2026-08-16T16:45:58.892474Z","submitted_at":"2022-07-14T13:00:22Z","title":"Recurrent Memory Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.06881","snapshot_observed_at":"2026-08-15T21:01:22.833253Z","title":"Recurrent memory transformer,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.833253Z"},"links":{"cited_paper":"/paper/2207.06881","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:6a6dc03bbb20dcfdca595544bc4d1e6f2dde31c0cbfbe0b3c4e83f98586b2245","observation_id":"bfcfe6a5-0e3c-4837-889d-77b8519d1689","resolution":{"observed_at":"2026-08-15T21:01:22.833253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.04451","last_updated":"2020-02-18T16:01:18Z","snapshot_observed_at":"2026-07-06T08:50:12.690900Z","submitted_at":"2020-01-13T18:38:28Z","title":"Reformer: The Efficient Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.04451","snapshot_observed_at":"2026-08-15T21:01:22.837715Z","title":"Reformer: The efficient transformer,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.837715Z"},"links":{"cited_paper":"/paper/2001.04451","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:203565f6c29d291903259ef5f3b7303636e14299fc45db4e5b4d42e6df526d1b","observation_id":"abedf9b8-7a34-40b0-b995-1881e58d5461","resolution":{"observed_at":"2026-08-15T21:01:22.837715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.361878Z","title":"Linear transformers are secretly fast weight programmers,","venue":null,"work_id":"87de3d3e-c41a-411c-a7e5-b14345efe4ee","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.829200Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9f56e6cc550f27c9aa984577bf681e0f2874104e48332af4b99e08f116b385b0","observation_id":"bdddb050-6020-4a30-b036-b7c46fca5a9f","resolution":{"observed_at":"2026-08-15T21:01:23.366622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13297","last_updated":"2023-05-25T17:01:13Z","snapshot_observed_at":"2026-08-16T15:30:58.286344Z","submitted_at":"2023-05-22T17:56:09Z","title":"Investigating the Role of Feed-Forward Networks in Transformers Using Parallel Attention and Feed-Forward Net Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13297","snapshot_observed_at":"2026-08-15T21:01:22.846703Z","title":"Investigating the role of feed-forward networks in transformers using parallel attention and feed-forward net design,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.846703Z"},"links":{"cited_paper":"/paper/2305.13297","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:c49c1fb9af991fea4b5f076efe77eca5ba59f942be87e96d4d1086c16218aed9","observation_id":"c186d155-232d-4e77-ac6e-696a6e491d05","resolution":{"observed_at":"2026-08-15T21:01:22.846703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.346602Z","title":"Rethinking transformers in solving pomdps,","venue":null,"work_id":"3d600cbd-9ea7-42f1-af1b-7ac607d0cb2d","year":2024},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.851223Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:19fd100c9db4df56186d109c2a81ee3d949fc1d2776a4b307ed9d8f11110e7e5","observation_id":"2057806e-73f7-49fb-943d-4dc4d76b0a5e","resolution":{"observed_at":"2026-08-15T21:01:23.351037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.14794","last_updated":"2022-11-19T12:45:21Z","snapshot_observed_at":"2026-08-12T04:58:34.201421Z","submitted_at":"2020-09-30T17:09:09Z","title":"Rethinking Attention with Performers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.14794","snapshot_observed_at":"2026-08-15T21:01:22.842169Z","title":"Rethinking attention with performers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.842169Z"},"links":{"cited_paper":"/paper/2009.14794","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:37cd169efd5c4495a5c132a95f612be03fb439e14d2a840be76e167c063d3493","observation_id":"a7a99566-99ec-4cd8-8365-799994a5d2cb","resolution":{"observed_at":"2026-08-15T21:01:22.842169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.317062Z","title":"Pomdp robot domains,","venue":null,"work_id":"5ad79392-a594-4e57-b52d-e1dda5b3081f","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.859622Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:f622f45ce8f1b45d188ddd37a6320a01e9175be927a903fa20c55cc832159888","observation_id":"0d42377e-36e6-426d-a376-46d3fb013090","resolution":{"observed_at":"2026-08-15T21:01:23.322069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.302287Z","title":"Learning policies for partially observable environments: Scaling up,","venue":null,"work_id":"8527a015-6e13-4926-9992-8ed74e75b599","year":1995},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.864054Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:70c886e5607353c6b46957fa0c785b598572b1261c753005ff3e4d4a49b07cc7","observation_id":"85361ea8-fcb7-41ea-82e3-c8634bc66ce6","resolution":{"observed_at":"2026-08-15T21:01:23.307086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.332424Z","title":"gym-gridverse: Gridworld domains for fully and partially observable reinforcement learning,","venue":null,"work_id":"36d64f4e-5e9b-44e6-a45d-18dc90a9a918","year":2021},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.855486Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:67abd6e302c7bd022661af3b6fefa852104c0c4d77426f5f0fc4bae7b2e21fc0","observation_id":"1f01bb95-6aeb-41f4-8076-af9d547f5e1c","resolution":{"observed_at":"2026-08-15T21:01:23.337172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:01:23.288084Z","title":"Solving large pomdps using real time dynamic programming,","venue":null,"work_id":"3ea95a31-ff8b-434e-9dfa-a751a760f443","year":1998},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.868400Z"},"links":{"citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:9914e8ef69605e876cb8b92e35d2b691cb7b58eb000a425fda7836bba29749bf","observation_id":"083fdfd6-0e13-46c0-a7d8-14ce4a391f09","resolution":{"observed_at":"2026-08-15T21:01:23.292669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.07978","last_updated":"2018-05-24T14:13:20Z","snapshot_observed_at":"2026-08-14T21:04:41.657382Z","submitted_at":"2017-04-26T05:55:07Z","title":"On Improving Deep Reinforcement Learning for POMDPs","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.07978","snapshot_observed_at":"2026-08-15T21:01:22.710231Z","title":"Available: https://arxiv.org/abs/1704.07978","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.710231Z"},"links":{"cited_paper":"/paper/1704.07978","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:dd06bde818f7d257d61118af70e3381f75fd06585724847fbeb28acc48b98579","observation_id":"1933d1b8-cf1c-4040-9f44-594c111672b1","resolution":{"observed_at":"2026-08-15T21:01:22.710231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02193","last_updated":"2022-02-12T20:01:53Z","snapshot_observed_at":"2026-08-17T02:57:21.304714Z","submitted_at":"2020-10-05T17:52:14Z","title":"Mastering Atari with Discrete World Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02193","snapshot_observed_at":"2026-08-15T21:01:22.778724Z","title":"Available: https://arxiv.org/abs/2010.02193 11","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T21:01:22.778724Z"},"links":{"cited_paper":"/paper/2010.02193","citing_paper":"/paper/2505.11153"},"observation_digest":"sha256:366e71d79c06ce477bcbfecfe9c99fbdef6c0e5534b46aab0c8c8b5313fe1152","observation_id":"926b6d1d-17ff-4c89-b562-24cb62e6ba2a","resolution":{"observed_at":"2026-08-15T21:01:22.778724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11153","last_updated":"2025-05-16T11:54:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-17T10:49:32.393803Z","submitted_at":"2025-05-16T11:54:48Z","title":"Bi-directional Recurrence Improves Transformer in Partially Observable Markov Decision Processes"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":1,"verified_fuzzy":26},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2505.11153."}