{"as_of":"2026-08-08T10:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a2fae8772384aea97f92a1478afd253f26c17843cd0b93b75e0c9dcfa8e6d1b3","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:05:26.101533Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.00795/citation-record","integrity":"/paper/2506.00795/integrity","json":"/paper/2506.00795/citation-record.json","paper":"/paper/2506.00795"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.717787Z","title":"Deep reinforcement learning at the edge of the statistical precipice","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.717787Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:eab7187c9f8b0388f70fb10f5d066ef74ae2ce2c2a49697a5be1cc8564bbbd38","observation_id":"ac9d45cc-7a9f-41d9-b013-0c0be567dee7","resolution":{"observed_at":"2026-08-07T12:05:25.717787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.723026Z","title":"On the estimation of production frontiers: maximum likelihood estimation of the parameters of a discontinuous density function","venue":null,"work_id":null,"year":1976},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.723026Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:b2c0f9621d7be327ce7ffc0be64a5e4a77e9922ccdc3328d62768e24d7981d74","observation_id":"0c629fa2-b676-4ebf-a403-7d3f06ebde26","resolution":{"observed_at":"2026-08-07T12:05:25.723026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.728070Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.728070Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5640c28e5416ee2b98bc1d2751d44dbff8405f3d2f778056ea9f6712b3a26a06","observation_id":"a6022746-c35d-493e-ab30-e9d86c9fab73","resolution":{"observed_at":"2026-08-07T12:05:25.728070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.07123","last_updated":"2021-01-18T15:33:26Z","snapshot_observed_at":"2026-08-08T04:32:25.769840Z","submitted_at":"2021-01-18T15:33:26Z","title":"Learning Successor States and Goal-Dependent Values: A Mathematical Viewpoint","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.07123","snapshot_observed_at":"2026-08-07T12:05:25.733026Z","title":"Learning successor states and goal-dependent values: A mathematical viewpoint","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.733026Z"},"links":{"cited_paper":"/paper/2101.07123","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1176da05750f5f36368c9fddab2e22c02c41b1588d9ab5d73c815c7eac53a6dd","observation_id":"0eec7250-8f73-4841-8163-0584315efc57","resolution":{"observed_at":"2026-08-07T12:05:25.733026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.119767Z","title":"Accelerating goal-conditioned reinforcement learning algorithms and research","venue":null,"work_id":"85467bdb-d89c-4281-b6e3-a870037fffc4","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.737574Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a6c5499386c67c115ee18e16dc3be765a8558fc593d8f53d123dbb11134a564d","observation_id":"d0775145-8232-416d-ad3c-985501eafa1c","resolution":{"observed_at":"2026-08-07T12:05:27.123474Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.742340Z","title":"Offline rl without off-policy evaluation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.742340Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:525027987dbfd73512c1c8c97460a476ee0bcf9bca88c670f9fd29085ab93c6e","observation_id":"fb9f4169-e126-4d26-8760-662962c2a265","resolution":{"observed_at":"2026-08-07T12:05:25.742340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.096505Z","title":"When does return-conditioned supervised learning work for offline reinforcement learning? Advances in Neural Information Processing Systems, 35: 0 1542--1553, 2022","venue":null,"work_id":"b9b3f6da-d3f0-43b7-b40a-71a0366d6b95","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.747851Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:f723ad2b3604ec14d255ac238f48aaa2e0810de000b2fda9a9cc743671e38f93","observation_id":"dc72a2a9-7eda-4695-8aeb-59ff29e0fce6","resolution":{"observed_at":"2026-08-07T12:05:27.100466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02013","last_updated":"2024-09-11T10:48:49Z","snapshot_observed_at":"2026-08-07T05:19:28.648698Z","submitted_at":"2024-06-04T06:49:18Z","title":"Mamba as Decision Maker: Exploring Multi-scale Sequence Modeling in Offline Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02013","snapshot_observed_at":"2026-08-07T12:05:25.752674Z","title":"Mamba as decision maker: Exploring multi-scale sequence modeling in offline reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.752674Z"},"links":{"cited_paper":"/paper/2406.02013","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:de83d24b5974bab7917ae1d85cf443baf54c86dd1d890e6eb5a1760ec32fdd69","observation_id":"1900dc52-3d95-4889-bea5-aa5ba811b9a9","resolution":{"observed_at":"2026-08-07T12:05:25.752674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.085338Z","title":"Goal-conditioned reinforcement learning with imagined subgoals","venue":null,"work_id":"ab3cfe17-075f-42f8-9cc7-6121d36721ee","year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.757238Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1043e192c45213d43193ba5d8b6b9e649a335257b75ee5429f5b1ba393e0f705","observation_id":"da09bc93-76e4-4615-9e8e-9c8fe5094a62","resolution":{"observed_at":"2026-08-07T12:05:27.088998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.069937Z","title":"On the statistical benefits of temporal difference learning","venue":null,"work_id":"859e3907-f92a-4084-b9b6-34f92ac505d1","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.761572Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5d1d7ac057b15c7adcac0468836f92a166fcc59324d3f8eec30b315cb31dad9f","observation_id":"d46ca468-7388-4700-9cb4-81b704157246","resolution":{"observed_at":"2026-08-07T12:05:27.073974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.766013Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.766013Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:80656df5a1cbba0fd966c6bddb47b0b351019fd98de92262f21ae3aba5c62183","observation_id":"05f055f6-a886-4d96-9ed4-26e1783a705a","resolution":{"observed_at":"2026-08-07T12:05:25.766013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.770153Z","title":"Goal-conditioned imitation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.770153Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:6c9199da1274023420293ad3808548368f098cc5168e830c86a9e9ebbbac24c4","observation_id":"40ee4e50-4a6d-48ab-a17f-d624539b2950","resolution":{"observed_at":"2026-08-07T12:05:25.770153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10751","last_updated":"2022-05-11T03:17:44Z","snapshot_observed_at":"2026-08-02T17:34:08.290568Z","submitted_at":"2021-12-20T18:55:16Z","title":"RvS: What is Essential for Offline RL via Supervised Learning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.10751","snapshot_observed_at":"2026-08-07T12:05:25.775369Z","title":"Rvs: What is essential for offline rl via supervised learning? arXiv preprint arXiv:2112.10751, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.775369Z"},"links":{"cited_paper":"/paper/2112.10751","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1f7102869bd7b47264b32209a663f67cd52d0c6b8122c1ee48f25b6257150bb2","observation_id":"b26c610a-459b-44af-9acb-69a25dc55670","resolution":{"observed_at":"2026-08-07T12:05:25.775369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.08909","last_updated":"2021-04-19T18:33:47Z","snapshot_observed_at":"2026-07-06T10:15:31.432847Z","submitted_at":"2020-11-17T19:58:56Z","title":"C-Learning: Learning to Achieve Goals via Recursive Classification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.08909","snapshot_observed_at":"2026-08-07T12:05:25.785189Z","title":"C-learning: Learning to achieve goals via recursive classification","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.785189Z"},"links":{"cited_paper":"/paper/2011.08909","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3e5564a2e56618b7ed0940c7f5959e4affa0ad408fa7fdc7e2fca21c2fdcaf55","observation_id":"bbad15d8-706f-4444-9661-dcec1aa5946d","resolution":{"observed_at":"2026-08-07T12:05:25.785189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.036546Z","title":"Imitating past successes can be very suboptimal","venue":null,"work_id":"99d412a4-f2c9-4b9e-b5f5-2de7cb3d76c8","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.797884Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:88323dc2ded51f46e61eb79a6a716653a35ff55e014dc4ea061c1bcdbfb0a214","observation_id":"6ffaf888-2f16-4a8a-8ffd-9d2ed56273b1","resolution":{"observed_at":"2026-08-07T12:05:27.041974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.022741Z","title":"Contrastive learning as goal-conditioned reinforcement learning","venue":null,"work_id":"132aea29-bd78-4b79-9b9f-4f20141695e3","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.806254Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:6f43615563c0bbef17affa995ee813bbe19982de03aa9a17533bcc9c0ea0d917","observation_id":"1b94d514-e345-483e-ab0f-72493bc2707a","resolution":{"observed_at":"2026-08-07T12:05:27.026589Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:27.005654Z","title":"Inference via interpolation: Contrastive representations provably enable planning and inference","venue":null,"work_id":"0010d16d-76ab-434f-a0fb-bd48d330e6a1","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.812950Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:963fa7dd31be962efb775af5273fdbf2a795e461d498e5f4dc94f002e4fd4e7d","observation_id":"8408698a-ec22-445f-8d72-8d4e4f62cfc2","resolution":{"observed_at":"2026-08-07T12:05:27.009713Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T12:05:25.820597Z","title":"D4rl: Datasets for deep data-driven reinforcement learning","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.820597Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5610f167527f9133de914ae6706a0dff838927366bd9ef3fddcc5cf521311d39","observation_id":"4e9db73b-ece7-43c6-9a15-e5a3a1b6028b","resolution":{"observed_at":"2026-08-07T12:05:25.820597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.828824Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.828824Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:8e022aa21687f7caeec147b24f3120a15fba57cc45b94ff94530119405b37bf1","observation_id":"6833a941-aa87-4b87-b910-42a1c54cfb00","resolution":{"observed_at":"2026-08-07T12:05:25.828824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.981939Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":"25e51bcc-a357-454c-bbba-50a58ec07be2","year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.836914Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:bf631246ee1b6a21959f6021d0a68340295ae0e588edc9765ab8e2c4a4963281","observation_id":"68403ab2-45bf-4103-8b10-8bdc7ef7f3bc","resolution":{"observed_at":"2026-08-07T12:05:26.986664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.968932Z","title":"Closing the gap between TD learning and supervised learning - a generalisation point of view","venue":null,"work_id":"a5f16acc-4b61-4dfd-9576-6098e952b343","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.845241Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:97619a4f96bfab637a69d469aec10432f476ced37acbc79400d90f7fb25ac1d7","observation_id":"2e8b731c-3160-440d-9f66-c4cc18ed1276","resolution":{"observed_at":"2026-08-07T12:05:26.973047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13774","last_updated":"2023-04-26T18:35:49Z","snapshot_observed_at":"2026-07-06T15:20:29.154658Z","submitted_at":"2023-04-26T18:35:49Z","title":"Distance Weighted Supervised Learning for Offline Interaction Data","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13774","snapshot_observed_at":"2026-08-07T12:05:25.851471Z","title":"Distance weighted supervised learning for offline interaction data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.851471Z"},"links":{"cited_paper":"/paper/2304.13774","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:ade28756770413665c382ad97d761a5e434f4a7d9fb6cbfe2311346dacbfba6d","observation_id":"36e41fa6-edff-4f22-af06-65760ef38fe7","resolution":{"observed_at":"2026-08-07T12:05:25.851471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.956585Z","title":"Diffused task-agnostic milestone planner","venue":null,"work_id":"a1325c06-7c50-409d-b9ff-207c6b808c1c","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.856909Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5f4236eee0edda5fcbea20d74337aa3e255e0ed586f6d142c5c19a40fe62a9c4","observation_id":"f7e355dd-8db1-498a-bbed-21c4b1f7bf24","resolution":{"observed_at":"2026-08-07T12:05:26.960312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00079","last_updated":"2024-05-31T10:41:03Z","snapshot_observed_at":"2026-07-06T18:23:31.520359Z","submitted_at":"2024-05-31T10:41:03Z","title":"Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling","version":1},"cited_work":{"arxiv_id":"2406.00079","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.00079","snapshot_observed_at":"2026-08-07T12:05:26.388725Z","title":"Decision Mamba: Reinforcement Learning via Hybrid Selective Sequence Modeling","venue":"cs.LG","work_id":"c3e60013-ef6d-44e2-8ff7-6539974042f9","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.860929Z"},"links":{"cited_paper":"/paper/2406.00079","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:bbbaf660c5a6176d240ca3477c0e44ba4801b3e05cb3915c9ca9feb5a3193d99","observation_id":"77b97c48-a143-4bf1-abcd-26486fc6b117","resolution":{"observed_at":"2026-08-07T12:05:26.394932Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.946265Z","title":"Learning to reach goals via diffusion","venue":null,"work_id":"267c4da0-6226-4fca-b258-1c6fa8f5abee","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.865082Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:52fa03e50d93b2ead14bd35c6bce83783cd00bf97341e832daa04fc0e26d9881","observation_id":"d2b47e03-40b7-4d65-91e9-1887d2c8aa79","resolution":{"observed_at":"2026-08-07T12:05:26.949447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.934748Z","title":"Efficient planning in a compact latent action space","venue":null,"work_id":"e318ce54-0dab-4260-9dff-243e1ec39760","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.869691Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a024ef98a1cbaeac5d0c39a6e1b5d2d31bf87b18921e50c081bd76da71c83416","observation_id":"95e9d632-ee99-466d-abfc-0287ee48a294","resolution":{"observed_at":"2026-08-07T12:05:26.938587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.924362Z","title":"Adaptive q -aid for conditional supervised learning in offline reinforcement learning","venue":null,"work_id":"d841c4a7-c0f2-4d37-9915-c7704462db6a","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.874197Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:9d69633915cfe596dea0fa67001a024d0753fbb2caec42da8f2b8b8b1fdca54d","observation_id":"333012e5-a28a-43fa-9fbd-f51f78732e31","resolution":{"observed_at":"2026-08-07T12:05:26.927879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11166","last_updated":"2023-03-20T14:51:10Z","snapshot_observed_at":"2026-07-06T15:05:42.338051Z","submitted_at":"2023-03-20T14:51:10Z","title":"Imitating Graph-Based Planning with Goal-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11166","snapshot_observed_at":"2026-08-07T12:05:25.878623Z","title":"Imitating graph-based planning with goal-conditioned policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.878623Z"},"links":{"cited_paper":"/paper/2303.11166","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4c0b91383fb37f83b0a7d28165c5b2f5d1415378a940365b6365c8758c7a9ac5","observation_id":"7cb756c9-6bfd-4cd5-993b-d1ddc942d258","resolution":{"observed_at":"2026-08-07T12:05:25.878623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.912762Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":"3c0322b3-5495-416a-8a9a-63848af2bee0","year":2014},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.883186Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:c9cb5235daacfcedbec3e674dc93a148021d83e05bd102d673330d6cce6cee20","observation_id":"991722db-63c3-41eb-83da-9416adc5569c","resolution":{"observed_at":"2026-08-07T12:05:26.916192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02691","last_updated":"2019-12-11T17:33:13Z","snapshot_observed_at":"2026-07-06T07:58:30.747165Z","submitted_at":"2019-06-06T16:35:38Z","title":"An Introduction to Variational Autoencoders","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.02691","snapshot_observed_at":"2026-08-07T12:05:25.887182Z","title":"An introduction to variational autoencoders","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.887182Z"},"links":{"cited_paper":"/paper/1906.02691","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:b9df9daf57cbd96d28ed2b9ebd699f3abe6426ba903965ad54b744c90964f002","observation_id":"3f22aaa2-4fed-44ab-a087-56d7c8e1c94a","resolution":{"observed_at":"2026-08-07T12:05:25.887182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.06169","last_updated":"2021-10-12T17:05:05Z","snapshot_observed_at":"2026-08-06T15:42:21.967989Z","submitted_at":"2021-10-12T17:05:05Z","title":"Offline Reinforcement Learning with Implicit Q-Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.06169","snapshot_observed_at":"2026-08-07T12:05:25.890730Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.890730Z"},"links":{"cited_paper":"/paper/2110.06169","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:2e5d0a9716f09865c6c6c74c0a1d8aa73e33f15d9bb6eda168453fd2a4b2d08e","observation_id":"0d1a09a9-e890-4949-a7ad-ce801bfbbe15","resolution":{"observed_at":"2026-08-07T12:05:25.890730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.894463Z","title":"Stabilizing off-policy q-learning via bootstrapping error reduction","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.894463Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:8e4b0f9e0efcc70ce20abd9cc2da7c79fef8c7d3de4566a6282e86da319e370e","observation_id":"6cac748e-1609-4fa2-8267-547de17c0893","resolution":{"observed_at":"2026-08-07T12:05:25.894463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.898096Z","title":"Conservative q-learning for offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.898096Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:cca8ecb1b0a04197f666a1dfdcf2d34d18a0533e92cddc25b9660c67bad100b9","observation_id":"e129b63b-db0d-4810-b0ba-659543a77553","resolution":{"observed_at":"2026-08-07T12:05:25.898096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.886183Z","title":"Multi-game decision transformers","venue":null,"work_id":"fad5a611-3a6b-4d3e-86ec-931922b74d1f","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.901393Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:c28b93c709fff05cf6f927ac398e339bc623e7e99f17d676ba495c6ab292f182","observation_id":"298c4dee-8b0d-474e-afad-c57e481b4223","resolution":{"observed_at":"2026-08-07T12:05:26.890075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.874031Z","title":"Dhrl: a graph-based approach for long-horizon and sparse hierarchical reinforcement learning","venue":null,"work_id":"5f279d45-5e6a-41e5-8264-e4bbb71633b4","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.904989Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:1a02a02bc2923abb96de277966b11624fbafe3f971c69e8596d2d417cf993688","observation_id":"4da2b345-5e0d-4d95-a039-aed07cae0242","resolution":{"observed_at":"2026-08-07T12:05:26.877877Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T12:05:25.909047Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.909047Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:aaa35d0cee808a3956eb70dcb4e51d967eaa38b4cff0a0c182c7ef2574235468","observation_id":"d0173034-cc60-47ef-acb7-cf86d44b445c","resolution":{"observed_at":"2026-08-07T12:05:25.909047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.859975Z","title":"Hierarchical planning through goal-conditioned offline reinforcement learning","venue":null,"work_id":"ce63ed17-c057-4444-b990-3c63e123c6a7","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.912606Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:eeb29ce5b97fd91f9d45388e43952561401e5946f4405c6dce36714efe9e5635","observation_id":"338ffa32-a5ea-4dcf-8a0d-aae0f181c06a","resolution":{"observed_at":"2026-08-07T12:05:26.865153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14790","last_updated":"2024-05-23T17:00:15Z","snapshot_observed_at":"2026-07-06T18:18:47.640933Z","submitted_at":"2024-05-23T17:00:15Z","title":"DIDI: Diffusion-Guided Diversity for Offline Behavioral Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14790","snapshot_observed_at":"2026-08-07T12:05:25.916444Z","title":"Didi: diffusion-guided diversity for offline behavioral generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.916444Z"},"links":{"cited_paper":"/paper/2405.14790","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:76c1ace18457af619539446f9208e99ea3794b5d1d30cd1446a8267f8e4b9873","observation_id":"2b3f252c-1f37-403b-ba3f-b2186e6ef988","resolution":{"observed_at":"2026-08-07T12:05:25.916444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.846225Z","title":"Beyond ood state actions: Supported cross-domain offline reinforcement learning","venue":null,"work_id":"88df59cd-5b0d-4517-bb57-e5104daa912a","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.920305Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:05b9b0dccbcef0a8281d07898e56da6e2292b6a0b0baa01a913346031840ed2b","observation_id":"ab0ce511-34ba-4e69-b886-0908976a8819","resolution":{"observed_at":"2026-08-07T12:05:26.850298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.924152Z","title":"Least squares quantization in pcm","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.924152Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:80b96897742a4c102e0bce66131bd19c004fb15653c7de4cd534c91f82f7102f","observation_id":"d1625f51-008d-47f1-a75b-80e9ec423a6f","resolution":{"observed_at":"2026-08-07T12:05:25.924152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T12:05:25.928161Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.928161Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e59b67c11050888d2fd609dcffc52183b789a877a9d0f78ecb989ed369db1da6","observation_id":"05f6f010-fa26-43cc-9226-12825383213b","resolution":{"observed_at":"2026-08-07T12:05:25.928161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05153","last_updated":"2025-05-05T16:26:30Z","snapshot_observed_at":"2026-08-07T17:22:58.699191Z","submitted_at":"2025-03-07T05:22:52Z","title":"Generative Trajectory Stitching through Diffusion Composition","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.05153","snapshot_observed_at":"2026-08-07T12:05:25.931670Z","title":"Generative trajectory stitching through diffusion composition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.931670Z"},"links":{"cited_paper":"/paper/2503.05153","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0cb70cccb34717d760053e4c0ba1b87ad1ec74388e4b493aa2ccd18bc6470cad","observation_id":"2a9bff04-ecfd-42a1-be87-47952d4c0d07","resolution":{"observed_at":"2026-08-07T12:05:25.931670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.819554Z","title":"Decision mamba: A multi-grained state space model with self-evolution regularization for offline rl","venue":null,"work_id":"13ecea6d-1214-4ec6-9fe1-64169a29c6fa","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.936092Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:035800d6a0a0b47742989923e66358779236674a2090932fabb044d84b1c5704","observation_id":"0ee3c592-d739-4461-ae0c-81d25979e657","resolution":{"observed_at":"2026-08-07T12:05:26.823899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.802688Z","title":"Learning latent plans from play","venue":null,"work_id":"33f42e99-1e2b-4322-81f7-f2f8b0618300","year":2020},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.939663Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e7bbd35871963d6018c9d4868576080d0bcd79e533b634eee44896a3fd819c3f","observation_id":"9161b203-157a-43c2-a75a-e6c58b3bf523","resolution":{"observed_at":"2026-08-07T12:05:26.807672Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03023","last_updated":"2022-11-10T05:13:14Z","snapshot_observed_at":"2026-08-04T16:14:02.245796Z","submitted_at":"2022-06-07T05:40:16Z","title":"How Far I'll Go: Offline Goal-Conditioned Reinforcement Learning via $f$-Advantage Regression","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.03023","snapshot_observed_at":"2026-08-07T12:05:25.943342Z","title":"How far i'll go: Offline goal-conditioned reinforcement learning via f -advantage regression","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.943342Z"},"links":{"cited_paper":"/paper/2206.03023","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4171d235179bbee0feb649fc1503b02778c782d356f4e67c556ed06e4abef705","observation_id":"7760b84f-ef4a-4c07-b158-dd9ed90e7346","resolution":{"observed_at":"2026-08-07T12:05:25.943342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.780255Z","title":"VIP : Towards universal visual reward and representation via value-implicit pre-training","venue":null,"work_id":"63886fa1-7bb8-4d6a-8dca-2c5ab5e97a5e","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.947029Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:70cda8f290ed20a8fe0199edbec1df251c4a9619a2ad54d8c13b3e6359689205","observation_id":"c121fe31-7789-4cdd-bd85-6da077e82bd2","resolution":{"observed_at":"2026-08-07T12:05:26.787378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.950640Z","title":"Human-level control through deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.950640Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:8b05fecd96116f3dfadb281fdd6bb18932c83d46648ea98867538b5399ab1c36","observation_id":"81535569-6821-4cf1-b589-a68adfbf95cf","resolution":{"observed_at":"2026-08-07T12:05:25.950640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17098","last_updated":"2025-03-10T07:33:32Z","snapshot_observed_at":"2026-07-06T18:36:26.223825Z","submitted_at":"2024-06-24T19:36:45Z","title":"Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17098","snapshot_observed_at":"2026-08-07T12:05:25.954383Z","title":"Learning temporal distances: Contrastive successor features can provide a metric structure for decision-making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.954383Z"},"links":{"cited_paper":"/paper/2406.17098","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:aca34d5e4bf4ed560377c5f9f15d6447b07e5d1fcf4e95166be73823b3443edf","observation_id":"b836f8df-5d17-418a-9393-f6a1a8ccaa13","resolution":{"observed_at":"2026-08-07T12:05:25.954383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.759285Z","title":"Asymmetric least squares estimation and testing","venue":null,"work_id":"a0c6e36d-13e5-44fd-8ff6-c5ae99e61fc0","year":1987},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.958453Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:b654c1c096d2863eb599ddfc8259e178599bfdbdf9606f3bf7690d5a7e8a6f92","observation_id":"d110249c-705f-4d70-a3d4-ceec22004d39","resolution":{"observed_at":"2026-08-07T12:05:26.763153Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19925","last_updated":"2024-03-29T02:25:55Z","snapshot_observed_at":"2026-07-06T17:52:54.875134Z","submitted_at":"2024-03-29T02:25:55Z","title":"Decision Mamba: Reinforcement Learning via Sequence Modeling with Selective State Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19925","snapshot_observed_at":"2026-08-07T12:05:25.961759Z","title":"Decision mamba: Reinforcement learning via sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.961759Z"},"links":{"cited_paper":"/paper/2403.19925","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a05a8b43780444f9467134ac6930b392abf8788a686ce612ba7fce5d4d1b18d1","observation_id":"6fff31ef-0216-4c08-a905-3cc793992213","resolution":{"observed_at":"2026-08-07T12:05:25.961759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:25.966571Z","title":"Hiql: Offline goal-conditioned rl with latent states as actions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.966571Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a8778283c7a9357f5c617d55636be1697b956947dd05ef49da8b0adacad45c71","observation_id":"49179c0b-5541-4a55-b2de-51de3d7635b3","resolution":{"observed_at":"2026-08-07T12:05:25.966571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15567","last_updated":"2024-05-26T17:44:52Z","snapshot_observed_at":"2026-08-07T05:14:40.258185Z","submitted_at":"2024-02-23T19:09:10Z","title":"Foundation Policies with Hilbert Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15567","snapshot_observed_at":"2026-08-07T12:05:25.970149Z","title":"Foundation policies with hilbert representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.970149Z"},"links":{"cited_paper":"/paper/2402.15567","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:3db2bceb36f522992842feb00d4674cd7875e5267b0ae5bd93d6228b31047b37","observation_id":"f5f5575a-0a9d-432b-9163-2d9147e6f3df","resolution":{"observed_at":"2026-08-07T12:05:25.970149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.736095Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":"4c96bb35-eec2-4f22-a5cf-434bc39971cc","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.975726Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:0032b2a7e895c9bf19db4893dffd7265ecca563857d38948bb57031591323bff","observation_id":"0b6d3909-af36-4f36-b8d2-07deef469bd8","resolution":{"observed_at":"2026-08-07T12:05:26.739722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.723683Z","title":"A survey on offline reinforcement learning: Taxonomy, review, and open problems","venue":null,"work_id":"b03b8de9-28b8-42d3-96c5-43791a592071","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.980393Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:a3b6f9bb8f67b9025e4118ac1f195d3b0abcbcca19f7596a537da3aea537c225","observation_id":"03cde593-9e7a-4b38-b8c0-d2b09ffe2fe9","resolution":{"observed_at":"2026-08-07T12:05:26.727985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02532","last_updated":"2023-06-01T15:18:21Z","snapshot_observed_at":"2026-08-06T03:03:48.750146Z","submitted_at":"2023-04-05T15:52:34Z","title":"Goal-Conditioned Imitation Learning using Score-based Diffusion Policies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.02532","snapshot_observed_at":"2026-08-07T12:05:25.984273Z","title":"Goal-conditioned imitation learning using score-based diffusion policies","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.984273Z"},"links":{"cited_paper":"/paper/2304.02532","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:f33b9daf9f8bcd6eb5d1295c5d4e39a702d2bdbf54c37e2c6851932d429b094f","observation_id":"738e246b-af48-488e-bd3d-3f9c6928ce3d","resolution":{"observed_at":"2026-08-07T12:05:25.984273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.711961Z","title":"Stochastic backpropagation and approximate inference in deep generative models","venue":null,"work_id":"16ce6d24-e3af-413f-b1cd-d66694fab7a2","year":2014},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.988205Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:49ca79ed3160f62e5af32ce4547a26c9a6db0d7fa2f5bbbcc7fd96a42dfc4688","observation_id":"0047489f-1d2b-4ace-91ba-3d824f4a0da4","resolution":{"observed_at":"2026-08-07T12:05:26.716004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.700656Z","title":"Outcome-driven reinforcement learning via variational inference","venue":null,"work_id":"b37701b8-e042-489c-822f-99b980258ccb","year":2021},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.994354Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:74247cab61426460c3a55b7d3132c9cd4f87e9fb68b4fc6f3bd561bdc218b676","observation_id":"f43cd76c-e99b-47ef-a3bc-6bd55c4b6680","resolution":{"observed_at":"2026-08-07T12:05:26.704287Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.688936Z","title":"Reinforcement learning upside down: Don't predict rewards -- just map them to actions, 2020","venue":null,"work_id":"a7ec01d7-10e6-496a-818a-1cfbe9ec7e7c","year":2020},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:25.998229Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e6253657474406e0ea8ed154aca85ea5884ee927451a0404e99ee1e3da9ef93c","observation_id":"5d75398f-09e4-484f-a1a0-d8b10e8421f6","resolution":{"observed_at":"2026-08-07T12:05:26.692774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.678296Z","title":"Rapid exploration for open-world navigation with latent goal models","venue":null,"work_id":"b563bb7a-e9d9-4fde-aaa8-4789b6980b2a","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.002289Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:e65b49e9d687bcc6c56c97e803ee6f5a571ebc314b66b82e1281b2d71f5cf609","observation_id":"a0ad97e9-02cb-4edd-8211-cb21fa4dab4d","resolution":{"observed_at":"2026-08-07T12:05:26.681724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.667176Z","title":"Score models for offline goal-conditioned reinforcement learning","venue":null,"work_id":"d43a280d-841d-44d2-8040-83b051c16715","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.006634Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:b5aaaca9cc87e12fe18067124b09887f1fae488c491dc6517bff562050afe28d","observation_id":"dfc8bf9e-530b-400e-a12c-6bd0d5fc4e6f","resolution":{"observed_at":"2026-08-07T12:05:26.670794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.656566Z","title":"Geoadditive expectile regression","venue":null,"work_id":"ce8dc6ce-6597-4ce7-b74f-724684f24ae1","year":2012},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.010660Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:5a1e8fe9cdd1ea09d349d0e6ca3a850e65e5040090d2225091bc4192a4594ec8","observation_id":"a9e70b2b-72cf-44f6-996f-cfd0632dad84","resolution":{"observed_at":"2026-08-07T12:05:26.659954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.014377Z","title":"Learning structured output representation using deep conditional generative models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.014377Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:525d74c60f3bce15024f44c09f684bd3d5cdefcd7ddf842b510902ba1a16e6e1","observation_id":"d9c00165-7d4f-4aeb-9178-49005ea0b73e","resolution":{"observed_at":"2026-08-07T12:05:26.014377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.636231Z","title":"Gymnasium (mar 2023), 2023","venue":null,"work_id":"fb136bfb-0aaa-4501-9a33-54ba98825d0e","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.018409Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:85ff768fd47befd0bf8ca8ebbdb57a8acc30eac4150d9f44dd676e6f25290f56","observation_id":"31cf407e-cc0a-4685-ae51-73d4d982f234","resolution":{"observed_at":"2026-08-07T12:05:26.639864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02648","last_updated":"2018-12-06T16:36:20Z","snapshot_observed_at":"2026-07-06T07:19:38.028327Z","submitted_at":"2018-12-06T16:36:20Z","title":"Deep Reinforcement Learning and the Deadly Triad","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02648","snapshot_observed_at":"2026-08-07T12:05:26.022196Z","title":"Deep reinforcement learning and the deadly triad","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.022196Z"},"links":{"cited_paper":"/paper/1812.02648","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:684c2ca47ee1fb869c1231c2eb066cf93c205c81c1ce1ec839ab2a3f5d8f558f","observation_id":"15c15ca4-5ecf-46a0-abb1-078650721ce1","resolution":{"observed_at":"2026-08-07T12:05:26.022196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.026210Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.026210Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:6d703669ee7a0ddf4717992189a77d7ecde6cec3f09d8d6c15a45f75915ce0b6","observation_id":"7e47b5a1-f2c6-4aec-b59c-e20c712aadcc","resolution":{"observed_at":"2026-08-07T12:05:26.026210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.615409Z","title":"GOP lan: Goal-conditioned offline reinforcement learning by planning with learned models","venue":null,"work_id":"46ec059b-bc9d-44f1-b0b4-8b8f6fb646bd","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.029722Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:342c35f0e7dabd7bb6710f582129a2fc6e6a2a217b73fbbaed00758e787962cd","observation_id":"c20b3ea7-d6cd-4f80-a058-c02026c8f25b","resolution":{"observed_at":"2026-08-07T12:05:26.619349Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.604221Z","title":"Optimal goal-reaching reinforcement learning via quasimetric learning","venue":null,"work_id":"5fbe7a21-ff73-4707-ae89-8afd4596b7dd","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.033672Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:f056290683553068b446f14316a46ff07ecb8e3d5e036518eaa85ac233a003ec","observation_id":"34fa6ff0-f0f9-4b0f-bac5-f5c5f9efce2b","resolution":{"observed_at":"2026-08-07T12:05:26.607776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.592556Z","title":"Critic-guided decision transformer for offline reinforcement learning","venue":null,"work_id":"26c1e7e1-7c28-4d60-8de1-65f732a2891f","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.038097Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:243701d2f5fa88c92ac2ac2c1a94454a3bf56d15d415d7b06a9f4f1cd1678550","observation_id":"4064caf9-0460-452a-a414-d3ea921924ee","resolution":{"observed_at":"2026-08-07T12:05:26.596625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.581099Z","title":"Supported policy optimization for offline reinforcement learning","venue":null,"work_id":"6dd68412-213d-46cd-9615-3d179954f11c","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.041485Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:afe5d2caacd24cb8f1b73c059c8edc20ee887074666e899538ab0ee4ccb7b0ff","observation_id":"1f240bd1-3f82-44a7-900f-bb0dcb6eb6ec","resolution":{"observed_at":"2026-08-07T12:05:26.584880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02484","last_updated":"2023-10-20T05:12:04Z","snapshot_observed_at":"2026-07-06T15:50:41.385379Z","submitted_at":"2023-07-05T17:58:21Z","title":"Elastic Decision Transformer","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02484","snapshot_observed_at":"2026-08-07T12:05:26.045615Z","title":"Elastic decision transformer","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.045615Z"},"links":{"cited_paper":"/paper/2307.02484","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:ef4659ad773e83b7b917fd09005e5a5b51b5706600ed9d29eeba80d2561f7ba9","observation_id":"e8e42e3d-1cdb-42c8-9228-c14463d124a2","resolution":{"observed_at":"2026-08-07T12:05:26.045615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.569740Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"93aafaaa-0ca0-48cb-8c4d-38e5672cb6d0","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.050121Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:24d856696821fe5fb3147fc66d25930a867fe341780c251b06211abad9a9eefe","observation_id":"ca8c62b3-2b08-4809-9704-568102ecae9d","resolution":{"observed_at":"2026-08-07T12:05:26.573852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04478","last_updated":"2022-02-14T04:26:50Z","snapshot_observed_at":"2026-08-08T06:59:27.948990Z","submitted_at":"2022-02-09T14:17:05Z","title":"Rethinking Goal-conditioned Supervised Learning and Its Connection to Offline RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04478","snapshot_observed_at":"2026-08-07T12:05:26.054551Z","title":"Rethinking goal-conditioned supervised learning and its connection to offline rl","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.054551Z"},"links":{"cited_paper":"/paper/2202.04478","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:c9fb9e401af032f2deda69f429f7858861db35b334669cf1f55a7d5b0f4e7197","observation_id":"158ff2de-8365-47d0-809c-dfad1cc405e2","resolution":{"observed_at":"2026-08-07T12:05:26.054551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.557148Z","title":"What is essential for unseen goal generalization of offline goal-conditioned rl? In International Conference on Machine Learning, pages 39543--39571","venue":null,"work_id":"b3b95ff6-5e32-41c3-b5d8-6141a168476f","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.058489Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:82d61aadb83318f3417b47f78987cc192a7803465e656762f0a9eb2d5e51cd6b","observation_id":"db0fa5c6-5581-4b25-87fb-013fcef04677","resolution":{"observed_at":"2026-08-07T12:05:26.561418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08865","last_updated":"2023-02-17T13:22:40Z","snapshot_observed_at":"2026-07-06T14:52:56.806494Z","submitted_at":"2023-02-17T13:22:40Z","title":"Swapped goal-conditioned offline reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08865","snapshot_observed_at":"2026-08-07T12:05:26.062222Z","title":"a m \\\"a r \\","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.062222Z"},"links":{"cited_paper":"/paper/2302.08865","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:67403e0e27f183b457fd6448c0bf553b4fd86ecceca9d853c42f23663b30caeb","observation_id":"77db9b91-9fca-46a6-9296-56fca0933486","resolution":{"observed_at":"2026-08-07T12:05:26.062222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.066117Z","title":"Breadth-first exploration on adaptive grid for reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.066117Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:305b669e4870088decd9463bfc39aa0508672bba22be9a882f3a1816876aa24e","observation_id":"2f8dd9a5-e9c1-4d76-af4a-b181000ab2fb","resolution":{"observed_at":"2026-08-07T12:05:26.066117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.535014Z","title":"Goal-conditioned predictive coding for offline reinforcement learning","venue":null,"work_id":"8a51587f-fa5d-462a-b535-6162d34b1bf3","year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.069683Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:78ab9b87f66cb223adb06425601a64436e2ecbe8be6fce514fccb81db255fb68","observation_id":"7fbcd7cd-bb20-4774-be4e-c2841fc8cbee","resolution":{"observed_at":"2026-08-07T12:05:26.539901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03346","last_updated":"2025-06-10T04:54:06Z","snapshot_observed_at":"2026-07-06T15:38:58.578200Z","submitted_at":"2023-06-06T01:36:56Z","title":"Stabilizing Contrastive RL: Techniques for Robotic Goal Reaching from Offline Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03346","snapshot_observed_at":"2026-08-07T12:05:26.072975Z","title":"Stabilizing contrastive rl: Techniques for offline goal reaching","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.072975Z"},"links":{"cited_paper":"/paper/2306.03346","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:ba5ae1608867275768c6184ebca46c46a23f5ba00bab0191c273a8c32ff24dc9","observation_id":"b155832e-295f-432b-bfcd-1de1323f54b8","resolution":{"observed_at":"2026-08-07T12:05:26.072975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.522331Z","title":"Contrastive difference predictive coding","venue":null,"work_id":"afa3088f-bd42-46e2-9b14-ac82ca450e0f","year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.076893Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:aa42f6605b9399b32bd2172aabd1fbebef5b4e1f0507683e9aac7dc684c3adff","observation_id":"1b355547-cf41-4fd4-860b-354833c8961b","resolution":{"observed_at":"2026-08-07T12:05:26.526281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.510099Z","title":"Online decision transformer","venue":null,"work_id":"a40c3f29-1490-44b4-b497-da07c394af80","year":2022},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.081476Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:cea16d0844043b8d191fd3e6b05bdc682868e4793f23b71253afe198b2b4dbdb","observation_id":"1007d93e-a759-4670-a9ae-ce0f34545b99","resolution":{"observed_at":"2026-08-07T12:05:26.514001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11312","last_updated":"2023-02-22T11:49:12Z","snapshot_observed_at":"2026-08-04T08:55:37.127470Z","submitted_at":"2023-02-22T11:49:12Z","title":"Behavior Proximal Policy Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11312","snapshot_observed_at":"2026-08-07T12:05:26.085023Z","title":"Behavior proximal policy optimization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.085023Z"},"links":{"cited_paper":"/paper/2302.11312","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:859bc6a10d5895e4af06bea80e970eb053ff98f836389cc405668e76513d62c3","observation_id":"2de92e6a-ec70-4159-9a24-cf51af5f8e47","resolution":{"observed_at":"2026-08-07T12:05:26.085023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08740","last_updated":"2024-06-02T10:15:53Z","snapshot_observed_at":"2026-07-06T18:14:16.386835Z","submitted_at":"2024-05-14T16:30:03Z","title":"Reinformer: Max-Return Sequence Modeling for Offline RL","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08740","snapshot_observed_at":"2026-08-07T12:05:26.091332Z","title":"Reinformer: Max-return sequence modeling for offline rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.091332Z"},"links":{"cited_paper":"/paper/2405.08740","citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:8644a0366fe9597e4751664feaf8f85710ca946c12566643e914300e41d0deda","observation_id":"1267e842-1074-4441-b705-b7277e3483cd","resolution":{"observed_at":"2026-08-07T12:05:26.091332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.495575Z","title":"Revisiting the design choices in max-return sequence modeling, 2025","venue":null,"work_id":"c1be6fd6-59bb-42d6-a186-afdd116f9c7e","year":2025},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.095894Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:4c33402054c6c872ddd39978ae26c58caf312a404bf9163f97f117d719dcf345","observation_id":"ad6054d5-8274-4dd4-b327-6f158fb0db69","resolution":{"observed_at":"2026-08-07T12:05:26.500024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:05:26.101533Z","title":"Maximum entropy inverse reinforcement learning","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T12:05:26.101533Z"},"links":{"citing_paper":"/paper/2506.00795"},"observation_digest":"sha256:cad3ef09dc88ebf06ce6277cb5b6e55a816022fba0db4147160829410b8b7931","observation_id":"fc578017-cce3-4fd5-bb09-46cadeecab2d","resolution":{"observed_at":"2026-08-07T12:05:26.101533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00795","last_updated":"2025-09-11T03:42:40Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:55:27.735310Z","submitted_at":"2025-06-01T02:49:26Z","title":"Closing the Gap between TD Learning and Supervised Learning with $Q$-Conditioned Maximization"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":41,"verified_exact":1,"verified_fuzzy":41},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2506.00795."}