{"as_of":"2026-08-07T19:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab1b92dfc1c4f5fee0c3530198b1e9a65683c01674a9457695ca471668d7f769","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:28:36.790121Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:05:07.831643Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-06T05:05:07.890229Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"cited_work":{"arxiv_id":"2505.15040","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15040","snapshot_observed_at":"2026-08-06T05:05:07.890229Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","venue":"cs.LG","work_id":"42574e29-b0b2-4411-ac14-3d66b31846a8","year":2025},"citing_paper":{"arxiv_id":"2608.05111","last_updated":"2026-08-05T17:44:52Z","snapshot_observed_at":"2026-08-07T19:22:38.970523Z","submitted_at":"2026-08-05T17:44:52Z","title":"Reward Structure Shapes the Interaction Between Episodic Exploration and Neural Memory in Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T05:05:07.831643Z"},"links":{"cited_paper":"/paper/2505.15040","citing_paper":"/paper/2608.05111"},"observation_digest":"sha256:d921f4c7cf9b8f0bbfae3d505a0d4492572c398a7fe70e04ed31913ce3516c8d","observation_id":"d9610706-0245-42e6-82d7-53dc9175e2f6","resolution":{"observed_at":"2026-08-06T05:05:07.908039Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.15040/citation-record","integrity":"/paper/2505.15040/integrity","json":"/paper/2505.15040/citation-record.json","paper":"/paper/2505.15040"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:41.817828Z","title":"What matters in on-policy reinforcement learning? a large-scale empirical study, 2020","venue":null,"work_id":"2fbe3dd9-c41a-46c1-ae7a-fc0a31805d18","year":2020},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.206676Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:4da036f5ea950023c8fea8c194c502c04dbf5ecff26c6499abda610c4db2dc63","observation_id":"c6106fea-1de2-43bd-88c1-f064a50f103d","resolution":{"observed_at":"2026-08-07T15:28:41.938153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:33.282105Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.282105Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:09963008065e2bc497889434d53d65f65d0ba9fae107a09c0a6e23b7c6b1f70b","observation_id":"f99f2355-1bc8-4c2c-af04-2fad1097b93c","resolution":{"observed_at":"2026-08-07T15:28:33.282105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:41.543070Z","title":null,"venue":null,"work_id":"e9f101a9-3dec-4769-b3c0-4f7c76a3ed14","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.436858Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:b925b144f24a752e1699c61c721cdd3e65847950cc51af37dafd4915b2f5f525","observation_id":"959058a0-368f-4807-9fe7-87f25a6ef6e0","resolution":{"observed_at":"2026-08-07T15:28:41.670666Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:41.339553Z","title":"Kovalev, and Aleksandr I","venue":null,"work_id":"00708c04-126e-4722-873b-1dfb6e845cc0","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.551580Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:d6ce7754c51fa5000a4563a77c00f1b780d1eb197f83cdee85a89969efaa4a31","observation_id":"0af9d966-68b8-4da4-9841-1f4664e5c7dc","resolution":{"observed_at":"2026-08-07T15:28:41.438864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:41.120328Z","title":"Minigrid & miniworld: Modular & customizable reinforcement learning environments for goal-oriented tasks, 2023","venue":null,"work_id":"c227c29a-4e4f-40c8-95e5-f4fe5b708d3f","year":2023},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.668828Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:07a017a40c821c000c8399a88129aad7d53c4e2a72396d2969576aaa78f5845c","observation_id":"f4302e45-ad40-4aaa-bf2f-d0656927aaa6","resolution":{"observed_at":"2026-08-07T15:28:41.211628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:33.788457Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.788457Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:146f43a5b519865e7805b16c1a226da93c1d5bc7d77f2e687275bc16d92b1f20","observation_id":"79cc64d2-2fff-4366-90b6-451c7b92622b","resolution":{"observed_at":"2026-08-07T15:28:33.788457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:33.909597Z","title":"Le, and Ruslan Salakhutdinov","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:33.909597Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:be1dc501d4e1699b1f0baa5ce9b82d239292dc2fe427c21ebb4c9b5ae392d08d","observation_id":"cad80d92-8636-4b54-a4c6-8c27093eac20","resolution":{"observed_at":"2026-08-07T15:28:33.909597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:40.835429Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":"884ea574-4ee2-42c8-9e0d-5e8b29625808","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.079669Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:ed45ff74d247ff66a6349a11090a491892a98e04eb45085fd57f03a6c791c010","observation_id":"25f3b796-ca9d-475f-b969-3f42124e8064","resolution":{"observed_at":"2026-08-07T15:28:40.997531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:40.596234Z","title":"Addressing function approximation error in actor-critic methods","venue":null,"work_id":"d8779b3d-a43f-4d39-95d2-807b39b82e13","year":2018},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.209058Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:33c188f13ca3104775cd9eb9be33bca12f4b3f2b3789ee28afe4380c826c0865","observation_id":"ac5bf077-82ac-44d3-b52d-d5b77df93f78","resolution":{"observed_at":"2026-08-07T15:28:40.719291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:34.339686Z","title":"Mamba: Linear-time sequence modeling with selective state spaces, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.339686Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:e5efe14b04d4cc463218a47c568478317d52e4338d269a2776f4ac7553d3929c","observation_id":"3cb30f82-13a3-476f-8bef-461584aee8f8","resolution":{"observed_at":"2026-08-07T15:28:34.339686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:34.462727Z","title":"Safe multi-agent reinforcement learning for multi-robot control.Artificial Intelligence, 319:103905, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.462727Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:1e0a9950eef51eabac750f19dc61930accfd838ac9a858b4ccba296ea510d06a","observation_id":"79fc7973-4af8-420d-9a92-4a68c75c8cb0","resolution":{"observed_at":"2026-08-07T15:28:34.462727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:40.407991Z","title":"Safe and balanced: A framework for constrained multi-objective reinforcement learning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2025","venue":null,"work_id":"2c8006b1-4bc5-4aac-b2f1-f9334e70db44","year":2025},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.598603Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:6c494b00ef72333502ce2d11de0a457937e2126c3863671dbd6d1f34f0b92c2d","observation_id":"83232638-4bd6-41a4-84fc-00c1b75aece6","resolution":{"observed_at":"2026-08-07T15:28:40.474550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:34.737787Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.737787Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:018b6d1fd2bdc83d09efc6e30c37d85886a4a57cc24d4cb582c0fcb9f1b4b85f","observation_id":"e4aa36a4-8f82-44c3-9459-8e32a412ba21","resolution":{"observed_at":"2026-08-07T15:28:34.737787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:34.828624Z","title":"Long short-term memory.Neural computation, 9(8):1735–1780, 1997","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.828624Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:730a358e3148b2d734d9bc19c85e7959fb47760277c2c0d3b0b43be13ff8b9c2","observation_id":"bba726a9-a79f-4f66-936a-e9f0be26ca87","resolution":{"observed_at":"2026-08-07T15:28:34.828624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:34.979587Z","title":"The 37 implementation details of proximal policy optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:34.979587Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:f88f1ae2fbf3d979c8633ba7657f50a2d94018407135f17348d937a91a3a3d99","observation_id":"d3e2b146-19c2-4334-954b-2e5eb1e22cff","resolution":{"observed_at":"2026-08-07T15:28:34.979587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:39.836903Z","title":null,"venue":null,"work_id":"76a2cb9e-caa0-472c-a491-6527851b63a1","year":2022},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.265411Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:2d2625634d9de493aa4e4f92b5e909be97b029b8c31cdbee72ffed6a95ccfcb5","observation_id":"996a4878-2a4d-4e5f-a1c8-5791e6ba4936","resolution":{"observed_at":"2026-08-07T15:28:39.966752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:39.599223Z","title":"Decision mamba: Reinforcement learning via hybrid selective sequence modeling, 2024","venue":null,"work_id":"fc7e31b2-ccdf-4eca-b524-c89141604130","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.380323Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:b11b3902671f7e027a4d16b6747c4806f8c6f633406131e44e9fa3a694a84f95","observation_id":"c0013807-108f-4a30-ba82-095d37b8792d","resolution":{"observed_at":"2026-08-07T15:28:39.702547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:39.322167Z","title":"Du, and Huazhe Xu","venue":null,"work_id":"f804c7ed-561f-4845-81df-b41846c25777","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.513888Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:8cd37903528f50b2e0f2868577a21163c1e3c6e056d06982d2db1a6b82372570","observation_id":"3ba1c3c0-f64a-49f6-a824-1acc9db8bb54","resolution":{"observed_at":"2026-08-07T15:28:39.471916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:38.972037Z","title":"Efficient recurrent off-policy RL requires a context-encoder-specific learning rate","venue":null,"work_id":"b9ccd1e3-bf49-46f0-8795-743dca6edd7e","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.656320Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:f687e2617107abaf565376fa2ee241f342dbaae13aec7f166ed3353b73ed827c","observation_id":"bbd87fdd-e57a-44b2-bedc-0657196f08e6","resolution":{"observed_at":"2026-08-07T15:28:39.170120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:38.639804Z","title":"Decision mamba: A multi-grained state space model with self-evolution regularization for offline rl, 2025","venue":null,"work_id":"e0fa34e8-e8b0-4298-a791-ce91fa8ee669","year":2025},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.846182Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:ec653a6f85aeae9e9070d14757cc740c3b686a2adc13de6d582d12241ee553b4","observation_id":"2a1c6f3f-f8ee-4dd5-b4c4-48f014ae176c","resolution":{"observed_at":"2026-08-07T15:28:38.809913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:38.365819Z","title":"Popgym: Benchmarking partially observable reinforcement learning, 2023","venue":null,"work_id":"adfaeff6-c78b-4090-b66b-6a6badcb665f","year":2023},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.950671Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:6f5b7baf141cbf8fdd9632a3c7d7cb9337c47fbf8ea7438006b465d79567b8fa","observation_id":"d29e2f8f-3b87-4eb5-a936-b175e1663822","resolution":{"observed_at":"2026-08-07T15:28:38.519287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:38.066354Z","title":"When do transformers shine in rl? decoupling memory from credit assignment, 2023","venue":null,"work_id":"a0a0442b-4777-46ea-93a7-1a477bd8d376","year":2023},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.065512Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:17f4b20c2f49d1bd7e27c0d0b520742f0dcd6fd934e6a189e7fc9045c2e4079a","observation_id":"b2b295c3-ef45-4214-90ae-3fa2b1792084","resolution":{"observed_at":"2026-08-07T15:28:38.227986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:37.810238Z","title":"Decision mamba: Reinforcement learning via sequence modeling with selective state spaces, 2024","venue":null,"work_id":"083ee6e1-6d02-4b85-8444-f5ea41ab459e","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.196985Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:93e52abde6ee62d19f7589ceae331b114f6e9a9086eb313c5747e6b18a600899","observation_id":"0b568af3-cf56-4d9a-8073-3086ca7d744a","resolution":{"observed_at":"2026-08-07T15:28:37.933547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:37.566193Z","title":"Francis Song, Jack W","venue":null,"work_id":"a85f0e80-256d-4079-85e9-34b6415745b5","year":2019},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.332756Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:0077f7752f5e2ab298c6d6b44bb875e3bebad13ab5936d1e382bcc07b211bdf8","observation_id":"a6e0cc61-88c0-4881-b376-71a9166ddc2d","resolution":{"observed_at":"2026-08-07T15:28:37.694539Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:37.365888Z","title":"Transformerxl as episodic memory in proximal policy optimization.Github Repository, 2023","venue":null,"work_id":"1a842517-5707-4e31-8be2-e759dc9a38e4","year":2023},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.456294Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:1e07d8d83659f24d39ec1aa4e4f36326052e546658d940038c14ee5a92196d51","observation_id":"896e1418-ee3c-4b2f-98cd-e6c2d2b0e9d9","resolution":{"observed_at":"2026-08-07T15:28:37.480182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:37.220457Z","title":"Memory gym: Towards endless tasks to benchmark memory capabilities of agents, 2024","venue":null,"work_id":"f151df34-64a3-407a-a12e-0d8d911b7a9c","year":2024},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.550031Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:f2a9e708e3668df747f445bd7c1c5b47182b5834bb3c3a91585131c26a09cdf0","observation_id":"806735a1-f767-4017-89ef-f929645697fd","resolution":{"observed_at":"2026-08-07T15:28:37.293317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:36.638559Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.638559Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:65150ace36c77e5e6007880ad844110d96ac594e94993e8dfd80e85cef99c35f","observation_id":"094d1ed2-1d67-4e4e-b3d8-ac6d31fa2498","resolution":{"observed_at":"2026-08-07T15:28:36.638559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:36.723806Z","title":"Mas- tering the game of go with deep neural networks and tree search.nature, 529(7587):484–489, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.723806Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:1fadc65bad377a8c4b0493931fcb3d0fbe1d4899849e3cede801e94e755a670e","observation_id":"ca03cca5-66c7-480e-b7cb-686f2195a7ca","resolution":{"observed_at":"2026-08-07T15:28:36.723806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"1378.82745","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:36.958740Z","title":"Mujoco: A physics engine for model-based control","venue":null,"work_id":"ebdcaf12-3598-464f-81f4-1a725ddcbb02","year":2012},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:36.790121Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:ddfd4c24516edb25b71ecb3c1c4d4051b7268bc522f901e1a79755a989bf33d8","observation_id":"ed1e8e2f-396c-41eb-adba-8127e43dcef3","resolution":{"observed_at":"2026-08-07T15:28:37.050856Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:28:40.103209Z","title":null,"venue":null,"work_id":"1cd4ea84-fadc-4bdf-863c-ecbe90b24d3f","year":2022},"citing_paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T15:28:35.157057Z"},"links":{"citing_paper":"/paper/2505.15040"},"observation_digest":"sha256:00ad6217b373e6ad6d11eb721d00c1aec780a876359181ac57dc68d0da61e9f7","observation_id":"b7625643-bee5-4928-9685-38c8dfbd0af1","resolution":{"observed_at":"2026-08-07T15:28:40.268447Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.15040","last_updated":"2025-05-21T02:49:25Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:22:57.020289Z","submitted_at":"2025-05-21T02:49:25Z","title":"RLBenchNet: The Right Network for the Right Reinforcement Learning Task"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":0,"verified_fuzzy":16},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 1 inbound Pith citation observation for arXiv:2505.15040."}