{"as_of":"2026-08-04T09:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b0a7edf96585bb5687821cef55b4dcbb5022ae2e903d44a45eb3f35c83d4b4b","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-23T19:19:41.734186Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T21:53:32.869133Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-10T06:15:00.866473Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.06347","doi":"10.48550/arxiv.2410.06347","metadata_source":"pith","pith_arxiv_id":"2410.06347","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","venue":"cs.RO","work_id":"20328ad5-066a-45fb-b24f-e78a890fb41a","year":2024},"citing_paper":{"arxiv_id":"2606.19211","last_updated":"2026-06-17T15:46:38Z","snapshot_observed_at":"2026-07-06T23:54:32.815760Z","submitted_at":"2026-06-17T15:46:38Z","title":"Thermal Characterization of a 6-Positioner, 6.2-mm-Pitch Module for Stage-5 Telescopes","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-26T19:04:57.917181Z"},"links":{"cited_paper":"/paper/2410.06347","citing_paper":"/paper/2606.19211"},"observation_digest":"sha256:2351f73ee0cb5d722d2132e50fb69f1761c3aa48591c69276f2458afd77dd258","observation_id":"f956a963-e53c-404d-b63e-f757a0583149","resolution":{"observed_at":"2026-06-26T19:09:47.784257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.06347","doi":"10.48550/arxiv.2410.06347","metadata_source":"pith","pith_arxiv_id":"2410.06347","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","venue":"cs.RO","work_id":"20328ad5-066a-45fb-b24f-e78a890fb41a","year":2024},"citing_paper":{"arxiv_id":"2606.20194","last_updated":"2026-07-01T08:00:21Z","snapshot_observed_at":"2026-08-02T11:10:24.128055Z","submitted_at":"2026-06-18T13:09:28Z","title":"MOSAIC at ELT: Design and First Prototyping of Novel Robotic Optical-Relay Positioners","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-06-26T15:44:00.688871Z"},"links":{"cited_paper":"/paper/2410.06347","citing_paper":"/paper/2606.20194"},"observation_digest":"sha256:7a01eb7058f3e66f384f0c77029fcd58d46efa2a5cab475c7ae13e578b577bc7","observation_id":"bd70a578-144a-4cfd-a86e-2789a07e38e5","resolution":{"observed_at":"2026-06-26T15:49:34.118136Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.06347","doi":"10.48550/arxiv.2410.06347","metadata_source":"pith","pith_arxiv_id":"2410.06347","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","venue":"cs.RO","work_id":"20328ad5-066a-45fb-b24f-e78a890fb41a","year":2024},"citing_paper":{"arxiv_id":"2606.20194","last_updated":"2026-07-01T08:00:21Z","snapshot_observed_at":"2026-08-02T11:10:24.128055Z","submitted_at":"2026-06-18T13:09:28Z","title":"MOSAIC at ELT: Design and First Prototyping of Novel Robotic Optical-Relay Positioners","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-01T07:12:00.596458Z"},"links":{"cited_paper":"/paper/2410.06347","citing_paper":"/paper/2606.20194"},"observation_digest":"sha256:b2c417b3476e970b3dfb12be580bb5ca6606175a881b5e7b1c6bec36f1d385e1","observation_id":"93d2eae1-8c9a-49e2-9ce5-34e100f1c3f8","resolution":{"observed_at":"2026-07-01T07:15:28.959274Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.06347","doi":"10.48550/arxiv.2410.06347","metadata_source":"pith","pith_arxiv_id":"2410.06347","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","venue":"cs.RO","work_id":"20328ad5-066a-45fb-b24f-e78a890fb41a","year":2024},"citing_paper":{"arxiv_id":"2606.20194","last_updated":"2026-07-01T08:00:21Z","snapshot_observed_at":"2026-08-02T11:10:24.128055Z","submitted_at":"2026-06-18T13:09:28Z","title":"MOSAIC at ELT: Design and First Prototyping of Novel Robotic Optical-Relay Positioners","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-02T21:53:32.869133Z"},"links":{"cited_paper":"/paper/2410.06347","citing_paper":"/paper/2606.20194"},"observation_digest":"sha256:0ecbc96b3e54b8ec5c0cb491e02519a65de61711722121b0336effb915a563b1","observation_id":"178e836e-6946-402a-83b0-57a44f73a673","resolution":{"observed_at":"2026-07-02T21:57:25.295558Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2410.06347","doi":"10.48550/arxiv.2410.06347","metadata_source":"pith","pith_arxiv_id":"2410.06347","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","venue":"cs.RO","work_id":"20328ad5-066a-45fb-b24f-e78a890fb41a","year":2024},"citing_paper":{"arxiv_id":"2606.31727","last_updated":"2026-06-30T14:26:58Z","snapshot_observed_at":"2026-07-31T22:08:01.640553Z","submitted_at":"2026-06-30T14:26:58Z","title":"Focal Plate Prototyping for Modular Focal Planes of Stage-5 Instruments For Ground-Based Telescopes","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-07-01T02:58:02.304450Z"},"links":{"cited_paper":"/paper/2410.06347","citing_paper":"/paper/2606.31727"},"observation_digest":"sha256:7a495d0d6060571cfea86a1f6c3b409a1da1cadd2a1563c22b71b565231fe9dc","observation_id":"9f5c952f-24cc-467f-a323-f4043d68a07e","resolution":{"observed_at":"2026-07-01T03:05:19.886126Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2410.06347/citation-record","integrity":"/paper/2410.06347/integrity","json":"/paper/2410.06347/citation-record.json","paper":"/paper/2410.06347"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Continuous improvement of self-driving cars using dynamic confidence-aware reinforcement learning","venue":null,"work_id":"3118549e-dd15-4a2b-b12a-24dea48f5f49","year":2023},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:cc944b1ebe0945b62c9659d849a7b994ccf2df11068159a5484acb7a962af47b","observation_id":"84edff24-2b89-4f50-8992-cd6bd5fac7fc","resolution":{"observed_at":"2026-05-23T19:35:48.791867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Efficient reinforcement learning for autonomous driving with parameterized skills and priors","venue":null,"work_id":"1d307660-5b4d-4a1b-9a8b-d2cafc8ade99","year":2023},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:2cd77dcc9f14caee4530038ba94ca4410d7e35077b86525d686836e51efe6a56","observation_id":"850965fa-ae20-4b29-b6b4-d41b50d37709","resolution":{"observed_at":"2026-05-23T19:35:48.799045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.12072","last_updated":"2022-09-24T18:50:30Z","snapshot_observed_at":"2026-08-01T16:30:36.122942Z","submitted_at":"2022-09-24T18:50:30Z","title":"Accelerating Reinforcement Learning for Autonomous Driving using Task-Agnostic and Ego-Centric Motion Skills","version":1},"cited_work":{"arxiv_id":"2209.12072","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.12072","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating reinforcement learning for autonomous driving using task-agnostic and ego-centric motion skills","venue":null,"work_id":"f96e0b91-27d5-4a91-87e5-7a028e7b697a","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"cited_paper":"/paper/2209.12072","citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:7e92bca7fc9b371a8ed8bad458b711cb9ec51aac29b8be09cfeee6f2a03942bf","observation_id":"286d4ce7-4b8c-4dbe-8ed4-862cde361653","resolution":{"observed_at":"2026-05-23T19:23:22.001111Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A review paper on implementing reinforcement learning technique in optimising games performance","venue":null,"work_id":"1d3d4815-5b61-43f0-b520-a2861ad6e203","year":2019},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:d77084a587f647ecacffe4557e44dc9ba2eafda74dd3e5c94dc26c3b42402825","observation_id":"d1801780-a45b-440b-85dc-3844daa3f373","resolution":{"observed_at":"2026-05-23T19:35:48.777371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modeling decisions in games using reinforcement learning","venue":null,"work_id":"b17fd2f8-7b44-4acd-8f9d-0d3a31fbbc54","year":2017},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:904d7cf3d4c7a03d739f757e92a5bde7426115ba7c71d1a9cc251fadd4ce1de4","observation_id":"c1a6db1a-5989-40f6-893d-7008e0be00c0","resolution":{"observed_at":"2026-05-23T19:35:48.773553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A unified game-theoretic approach to multiagent reinforcement learning","venue":null,"work_id":"ec86cd0a-ad65-49a0-adc4-b5983a84fa80","year":2017},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:a82f70c978764360991758ce74f831bd31ec33b515ec4616adcbd9cc48b073cf","observation_id":"cacc591a-b8c4-4e46-baaa-262d523dacb1","resolution":{"observed_at":"2026-05-23T19:35:48.784016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accelerating robotic rein- forcement learning via parameterized action primitives","venue":null,"work_id":"2867920f-4a67-4f6f-85e3-4f8b0cf6e102","year":2021},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:3281369cb8cbb5a1730f6db26cea6b5a679aeb2d7628f6ce20f8b01a78852a74","observation_id":"ef4ea0f5-2914-478f-8f86-0c131670bb0a","resolution":{"observed_at":"2026-05-23T19:35:48.787154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Review of deep reinforcement learning for robot manipulation","venue":null,"work_id":"4b613f22-60bc-441a-8230-47462e7d279a","year":2019},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:521aebdea4938fabb86b2db9bc1d78ac1e56416b72354ce2e633346b1ddf2297","observation_id":"a036656a-e8eb-409b-bceb-65e996eb8052","resolution":{"observed_at":"2026-05-23T19:35:48.802431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"31229d05-dbc4-4b66-a018-e026565885d5","year":2018},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:f736b0f5c51375eee1b4d084971cfa4bdcaaf94800fc3cded1c4a4d02104641c","observation_id":"c01d7920-de56-427f-b130-3ee6a1f0b8c7","resolution":{"observed_at":"2026-05-23T19:35:48.780393Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.01540","last_updated":"2016-06-05T17:54:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-06-05T17:54:48Z","title":"OpenAI Gym","version":1},"cited_work":{"arxiv_id":"1606.01540","doi":"10.1109/jssc.2019","metadata_source":"pith","pith_arxiv_id":"1606.01540","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"OpenAI Gym","venue":"cs.LG","work_id":"6af98f3f-f074-41ae-a689-7dd7b4b8efde","year":2016},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"cited_paper":"/paper/1606.01540","citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:6c407483dd72571987ea4985c43664151508156efc98849efb778dc747a98cb1","observation_id":"0ee34de0-cb4b-45bf-bc03-bbe86f2da51a","resolution":{"observed_at":"2026-05-23T19:23:22.005377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"panda-gym: Open-Source Goal-Conditioned Environments for Robotic Learning","venue":null,"work_id":"133029a3-38c9-4ae7-9cc5-3b7a66cca06c","year":2021},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:3403ef629c136bfe9c764b69441c2961b6be929716b3674a134c85c6babe6b23","observation_id":"d032b47a-5505-40b5-be1e-1ad71d2477a7","resolution":{"observed_at":"2026-05-23T19:35:48.908599Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sim-to- real transfer of robotic control with dynamics randomization","venue":null,"work_id":"130fb735-9be4-4b8e-beca-0a54824febf1","year":2018},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:89ef7b1e0db69c5b0268b898154672a0b48814849f6117af4917e627b24c0c28","observation_id":"bbba70a4-f4d1-4db7-9791-54579520a7f2","resolution":{"observed_at":"2026-05-23T19:35:48.889551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1145/3054912","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imitation learning: A survey of learning methods","venue":null,"work_id":"161a2690-6f3a-42ae-b3ac-4c245b9d32ee","year":2017},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:ee20d4d2a214ccd381bd35986f9757c7706be115807f47440a29e1a992bbe042","observation_id":"cf798189-0a7f-45ca-b31e-b78fe81180bc","resolution":{"observed_at":"2026-05-23T19:23:21.521674Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":"b00683af-4519-466e-a6e4-3b8b3c6f8824","year":null},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:d77831f4167b7e8b438e69c5ac90b8f6788963a4266f4da3aedff3d3ab1f8288","observation_id":"47941169-f57f-40bf-8c80-a537de1d4eb2","resolution":{"observed_at":"2026-05-23T19:35:48.897189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8eaab721-4bc0-49fe-8221-0318d7aa5d12","year":2020},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:c05e66e14e5b710ebe04e0c6b449d1b08f4c40cc4ead0114251ced120e3411d3","observation_id":"30bd9d1a-662d-42e8-a9a0-4337e2d1f544","resolution":{"observed_at":"2026-05-23T19:35:48.885520Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latte: Language trajectory transformer","venue":null,"work_id":"4b4ef8d5-9390-4c6b-ae72-be21cb8b4f2f","year":2023},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:b709223a3b1f5f77957055e00de43c82b4e30c3773e18bb1c3b83f1a6fb89e1e","observation_id":"161316da-2041-470d-9741-019ccd02702f","resolution":{"observed_at":"2026-05-23T19:35:48.914688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Perceiver-actor: A multi- task transformer for robotic manipulation","venue":null,"work_id":"f36bc987-7fb5-483d-8d98-1f94771a6e44","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:2b8f61cbe284a24ecad66d23d0f03fff64d8617d1451df8a077930ed19363385","observation_id":"8271081f-bb5e-4856-82d9-8a2bb8902a3c","resolution":{"observed_at":"2026-05-23T19:35:48.877016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"On transforming re- inforcement learning with transformers: The development trajectory","venue":null,"work_id":"57e9dfef-839d-44c4-8d05-019393ccfc82","year":2024},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:ff21d17a329d7ae24a5529375b7c7402a1b5cfb185c889b9c82dc1c807342082","observation_id":"ae938129-9db2-49cc-8700-f5e82854ca46","resolution":{"observed_at":"2026-05-23T19:35:48.881761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A survey on transformers in reinforcement learning","venue":null,"work_id":"22ed292e-9bc5-48a8-90c1-5119401e69f1","year":2023},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:c6519ea526d3823da6be8d4b71657368872b2146db2849c8f8d018b2ee1e20b6","observation_id":"885f8c90-8f30-45f5-b6e4-cee7859db524","resolution":{"observed_at":"2026-05-23T19:35:48.893193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":"72faa006-cbba-46f0-a4d9-e40903f2c252","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:c2c04daf18e2dce402e7beefac64d20d0b2cf982f18ffe55280a3e7f4915a8d5","observation_id":"65e72c31-4bd5-4b4b-bdae-da647184d2e9","resolution":{"observed_at":"2026-05-23T19:35:48.903771Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformers are adaptable task planners","venue":null,"work_id":"66e0cdbe-2592-4019-9dfb-46cc328936c1","year":2023},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:7a9f2e211490229b4f422998de6860a15a36da4af7c6a8e2ba15ac31fdeab347","observation_id":"90ff73dc-e9f9-4c69-a3fb-fd6442d677f7","resolution":{"observed_at":"2026-05-23T19:35:48.866270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prompting decision transformer for few-shot policy generalization","venue":null,"work_id":"b4970142-1d2d-4104-8628-019eac681068","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:9a30d6c91548538ff9c59d5aea185dbfc7e76743701f27fdbe138f9a7f99ac0b","observation_id":"3e288de5-0efc-439b-93c9-069569139882","resolution":{"observed_at":"2026-05-23T19:35:48.873229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-game decision transformers","venue":null,"work_id":"68d95125-1d30-40de-b2d9-b30a02c63087","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:631aa56b6b726c669ec932d1ac079857aa4a8960b2cc5ae55d86c30c8b9d2c3d","observation_id":"b39513d0-9bcd-43b4-92c9-552970012e25","resolution":{"observed_at":"2026-05-23T19:35:48.858297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":"318e19a3-39a1-4fb0-8a80-49a093771a45","year":1979},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:a040a0f1b86552569dcca609eb1ce12945211c95966d6a4dae2987740f6c7d15","observation_id":"bc16a4ab-37ca-448f-8150-8839ff437025","resolution":{"observed_at":"2026-05-23T19:35:48.925252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self- learned intelligence for integrated decision and control of automated vehicles at signalized intersections. ieee transactions on intelligent transportation systems","venue":null,"work_id":"daf62470-3f6a-4f81-a5c2-74e1a4104910","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:fc591f5f82083b936018789bcc63f0fc8146503ce7e53f5c82e487d092f35738","observation_id":"106383a2-24f9-4bda-bf53-d295afe9424f","resolution":{"observed_at":"2026-05-23T19:35:48.851195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Community energy storage operation via reinforcement learning with eligibility traces","venue":null,"work_id":"8693818b-857a-429d-8244-8ac6a37077e1","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:2c8c896e29f7871abfe8943789817c930ab9cf412f86621cb114e2243a705b1d","observation_id":"aadffd42-19e2-451f-91be-ca368fdfd918","resolution":{"observed_at":"2026-05-23T19:35:48.854896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hind- sight experience replay","venue":null,"work_id":"61b6a9db-f86d-42be-a9e8-a2a0421dfa40","year":2017},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:a7c9b2857fc8a1ab4ba47de7c405574fc5792d2c7bed6049da9e2dd2f37150ab","observation_id":"c17c9db9-534f-4d93-a51a-b52d9accec70","resolution":{"observed_at":"2026-05-23T19:35:48.862303Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Soft actor-critic: Off- policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":"7a9e5745-1642-4106-a180-3f6e77eb43cd","year":2018},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:2e2495c250ec8ddf323678de2a8e53ea41b36e72d1369ce728a04a521f4a899f","observation_id":"0f675822-3f1e-4596-8272-3acdf1b6afbc","resolution":{"observed_at":"2026-05-23T19:35:48.918578Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Controlling overestimation bias with truncated mixture of continuous distributional quantile critics","venue":null,"work_id":"b3d66269-d7bd-4669-a7a3-3f9523ead9ba","year":null},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:7aac6de0b1ea3961b34add8a669401e673e1485969b37bb6065a783ac33d4367","observation_id":"bb91f4e6-2189-4311-994b-ffeb4168a631","resolution":{"observed_at":"2026-05-23T19:35:48.837873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Playing atari with deep reinforcement learning","venue":null,"work_id":"5a94a36f-dd2e-4595-a07e-e5f8c6877fed","year":2013},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:d9d0c41b395144761335c3aa7dec3f0100d061967644d8df814dc4ec44764022","observation_id":"67d98814-66c9-48e7-8ed8-ca6e32832277","resolution":{"observed_at":"2026-05-23T19:35:48.795505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Reinforcement learning and markov decision processes","venue":null,"work_id":"d4266f28-fb69-45e1-a903-a6cf128fc1b5","year":2012},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:7468967b6e3191b191d3e0ee3c891ccaaef3d32cc77091c051487f7a3ac13cb9","observation_id":"39b1813a-58df-42e0-90c3-d933a5eff0ff","resolution":{"observed_at":"2026-05-23T19:35:48.846835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning with double q-learning","venue":null,"work_id":"18a5c1c6-b0de-4d56-814d-03d13360bb1f","year":2016},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:37143c256db548b0603a19c2cd197d1fbe550de9222f10b74f250d0fcb63d199","observation_id":"9462d9c6-a1d9-4df0-9218-28b67dc80682","resolution":{"observed_at":"2026-05-23T19:35:48.834208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning policies learn shared adversarial features across mdps","venue":null,"work_id":"6ca407cb-b5cf-4975-b603-1c4895806486","year":2022},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:827401d43aaeceb22ee5cc02b596975035988c69b24f4401a8735b1a7b17e9b3","observation_id":"8687b96c-21cc-4fa9-b510-ce532e252e43","resolution":{"observed_at":"2026-05-23T19:35:48.921689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":"1707.06347","doi":"10.1016/j.artint.2010.12.005","metadata_source":"pith","pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Proximal Policy Optimization Algorithms","venue":"cs.LG","work_id":"240c67fe-d14d-4520-91c1-38a4e272ca19","year":2017},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:bc556364d4d5bdf5a280e3ac80bf753eda64fc007d7bbd7564f9e2bf9fa08969","observation_id":"02ec155d-0494-4fb1-937c-2cd0de6ba483","resolution":{"observed_at":"2026-05-23T19:23:22.020402Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Implementation matters in deep rl: A case study on ppo and trpo","venue":null,"work_id":"61c763fd-a4f1-4f43-9728-e9f4e6aa7b6c","year":2019},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:d988f43d6adf84c82bcc82a9e92c38a44ce43370b9fcd0f79e29392e28657f7b","observation_id":"f0e0a9d9-f8ad-428d-b757-de63e2c05602","resolution":{"observed_at":"2026-05-23T19:35:48.827088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1502.05477","last_updated":"2017-04-20T18:04:12Z","snapshot_observed_at":"2026-07-06T04:09:39.172428Z","submitted_at":"2015-02-19T06:44:25Z","title":"Trust Region Policy Optimization","version":5},"cited_work":{"arxiv_id":"1502.05477","doi":"10.48550/arxiv.1502.05477","metadata_source":"pith","pith_arxiv_id":"1502.05477","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Trust Region Policy Optimization","venue":"cs.LG","work_id":"8660ac94-3f8e-474f-967f-98304c415ed7","year":2015},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"cited_paper":"/paper/1502.05477","citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:d7c9ed5e12c7299316d3e44ffc672f4a5fb9c4bec885332e0bc556bbd1880250","observation_id":"aa0a5de3-df1a-458a-b90e-b9101094ac50","resolution":{"observed_at":"2026-05-23T19:23:22.015331Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous methods for deep reinforcement learning","venue":null,"work_id":"4c8ec5d7-2751-4b86-a077-75d0be83b30d","year":1928},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:10a76fff7d237578c8a52385d3a62a05159c258baec328c2140a52d852f1d0f5","observation_id":"fb5b8fff-81f7-4475-adb1-1ae68c40f5eb","resolution":{"observed_at":"2026-05-23T19:35:48.830233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Distributional soft actor-critic: Off-policy reinforcement learning for addressing value estimation errors","venue":null,"work_id":"de76b4f0-16d6-4cf5-a852-3c10b1893483","year":2021},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:84f5ea20f0a842a31e52e2b74d11ced67c5caba2fa46e98c7aa3a771f4f701b5","observation_id":"7b5fcbbb-c35e-46b4-8f38-97b9735986d8","resolution":{"observed_at":"2026-05-23T19:35:48.842240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An introduction to deep reinforcement learning","venue":null,"work_id":"4ffc10a2-0147-40e6-97ad-c5313cdd1249","year":2018},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:2cd12671aa95514bdd31ee9da258066fd0b20d70144bef60bc30b4bf7f61be0f","observation_id":"898e9e51-7139-47f9-be42-157898049245","resolution":{"observed_at":"2026-05-23T19:35:48.869703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1802.09464","last_updated":"2018-03-10T18:11:25Z","snapshot_observed_at":"2026-08-02T00:57:15.173797Z","submitted_at":"2018-02-26T17:20:14Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","version":2},"cited_work":{"arxiv_id":"1802.09464","doi":null,"metadata_source":"pith","pith_arxiv_id":"1802.09464","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-Goal Reinforcement Learning: Challenging Robotics Environments and Request for Research","venue":"cs.LG","work_id":"885194fc-d60a-4643-9eaf-ba0dca0e6165","year":2018},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"cited_paper":"/paper/1802.09464","citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:7371c28bb5095b595d63b2953a4b6064a29e0d25dacfeef25810c238d85fe21f","observation_id":"6ff63101-4d74-499a-bf77-fb33007d9163","resolution":{"observed_at":"2026-05-23T19:23:22.010306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"234b2dc7-21a4-4dde-88e3-aac3b7527ec2","year":2020},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:0e0974dbbafc078ef0b0f29c422037456c8943d74c0b7b68a85b2ec8a5765897","observation_id":"d5d4cc32-ead2-431f-89c6-b509847124ce","resolution":{"observed_at":"2026-05-23T19:35:48.900545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre- training of deep bidirectional transformers for language understand- ing","venue":null,"work_id":"d8b9471b-efa3-4045-a13a-293d74e6681d","year":2019},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:a112dd2bbd5dd911fbe561e3f8863dec8a946e9c0b3052878faa166799cd3da9","observation_id":"3d6c068e-0b4a-4410-95ee-106b92e3ecb4","resolution":{"observed_at":"2026-05-23T19:35:48.823200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"c717c46d-57e9-49db-8011-3d457be5f608","year":2021},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:11c8eafc103bda508ef535059f964073b983061bd60437906ffe041e63e9bd0a","observation_id":"0e0f80a1-cf50-499e-9384-4e7b230044db","resolution":{"observed_at":"2026-05-23T19:35:48.818997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Attention is all you need. in advances in neural information processing systems","venue":null,"work_id":"eff8c408-d6ce-4b73-90dd-1c3031dd2a23","year":2017},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:36165600f5841a9a3848918b26a79c44c7372d800dcbecda265bf8ac246c37cd","observation_id":"2876935b-d311-472d-908c-0ef87727e476","resolution":{"observed_at":"2026-05-23T19:35:48.807332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03662","last_updated":"2021-04-19T18:00:46Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T20:09:20Z","title":"Rapid Task-Solving in Novel Environments","version":3},"cited_work":{"arxiv_id":"2006.03662","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2006.03662","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rapid task-solving in novel environments","venue":null,"work_id":"f40b2388-a0f8-4dfc-aa08-84792e37ab62","year":2006},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"cited_paper":"/paper/2006.03662","citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:7a7e3aa3b8d860abeb779a33ecbae539fab90a7cbb01fb61c6332bcfbb4e3e5a","observation_id":"76a7d76a-dbe5-464f-ada7-be26e5e56e41","resolution":{"observed_at":"2026-05-23T19:23:22.025663Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi-objective decision transformers for offline reinforcement learning","venue":null,"work_id":"4a747eed-9c85-4475-95bd-a1fc78b9271f","year":2023},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:d680387fbcdb425e111dbbaef890165f136d28c0c69e4164bbc1e2ef5a06f0c7","observation_id":"67434522-f368-468c-8a1d-77ac60cefe4f","resolution":{"observed_at":"2026-05-23T19:35:48.811305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rl baselines3 zoo","venue":null,"work_id":"e982ab52-92b8-4952-ae3c-6d4c3ad9326e","year":2020},"citing_paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-23T19:19:41.734186Z"},"links":{"citing_paper":"/paper/2410.06347"},"observation_digest":"sha256:20c9556ab8f299bd1fde0e629cb8c8c6820f1801b03286572b7e5c5800514fe8","observation_id":"0f7e8fd1-8a66-430a-9c65-153380585986","resolution":{"observed_at":"2026-05-23T19:35:48.814843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2410.06347","last_updated":"2026-05-08T17:41:30Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-07-06T19:30:00.101083Z","submitted_at":"2024-10-08T20:35:30Z","title":"Goal-Conditioned Decision Transformer for Multi-Goal Offline Reinforcement Learning"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":7,"verified_fuzzy":38},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 5 inbound Pith citation observations for arXiv:2410.06347."}