{"as_of":"2026-08-08T02:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0cf0e27200ab58791b8411c69fc6b464a5794ef96472d1ac2a0fb488ad4f2644","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:19:10.275156Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.08463/citation-record","integrity":"/paper/2506.08463/integrity","json":"/paper/2506.08463/citation-record.json","paper":"/paper/2506.08463"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:19.078541Z","title":"When does return-conditioned supervised learning work for offline reinforcement learning? Advances in Neural Information Processing Systems, 35:1542–1553, 2022","venue":null,"work_id":"c957c6a4-2080-4e11-8dd5-ed200292aab7","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.103676Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:fa47aa4cd0fb32fb4b7a3875d1bb2d7ec2b16a93de6807ff59b71d0b05133c52","observation_id":"fcfc7757-4214-4f91-b109-8f106280f373","resolution":{"observed_at":"2026-08-07T05:19:19.174686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.889811Z","title":"Decision transformer: Reinforcement learning 1For two distributionsPandQ,P≪QmeansPis absolutely continuous w.r.t","venue":null,"work_id":"729a4c2d-7cbb-4206-b7ba-f0aea0790f41","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.192132Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:713c69a9442553f1105bd21a76ea71b49e8eceef6626fb94444c2811b1ce2e86","observation_id":"5b9ca6b3-c313-4672-b65b-880e92d71eaa","resolution":{"observed_at":"2026-08-07T05:19:18.989128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.678476Z","title":"Rvs: What is essential for offline rl via supervised learning? InInternational Conference on Learning Representations,","venue":null,"work_id":"cd5f87d8-c76e-4e97-a9e8-fbe8f4be64ce","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.330667Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:883c05262e8c5af009cb80793fe2d5778063f7e9dfc7274085ff0518738510c1","observation_id":"632f3e8c-a2d3-4cd7-99cb-80ca75d930d9","resolution":{"observed_at":"2026-08-07T05:19:18.778572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.249287Z","title":"Imitating past successes can be very suboptimal.Advances in Neural Information Processing Systems, 35:6047–6059, 2022","venue":null,"work_id":"b067732d-92c1-42c5-9614-dba35f985c5e","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.670336Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:2570101db5326dfe2928cb11c308ff32d54dc5bb755c37fc77766742d074e0cd","observation_id":"8059f672-d218-4f2a-bb9e-0686a58617fe","resolution":{"observed_at":"2026-08-07T05:19:18.350689Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.07219","last_updated":"2021-02-06T01:57:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-04-15T17:18:19Z","title":"D4RL: Datasets for Deep Data-Driven Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.07219","snapshot_observed_at":"2026-08-07T05:19:04.868201Z","title":"D4rl: Datasets for deep data-driven reinforcement learning.arXiv preprint arXiv:2004.07219, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.868201Z"},"links":{"cited_paper":"/paper/2004.07219","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:42fccd4bdab6b627ac01c3909e2a7c58f6722b6df3bbd5fedfb2452038011ee6","observation_id":"2ecf1c2e-1149-4524-a53e-55a7f1a8a4b7","resolution":{"observed_at":"2026-08-07T05:19:04.868201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.080696Z","title":"A minimalist approach to offline reinforcement learning","venue":null,"work_id":"8011b270-cc99-4701-9bd4-6cb52d7fcb63","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.017626Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:9f14e1d3f9736d046fc59d3812f20b7b74544037a7c9bb5de0d41787bf533501","observation_id":"6cbb6611-c082-4463-9026-07bfd459cf24","resolution":{"observed_at":"2026-08-07T05:19:18.154249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.875760Z","title":"Generalized decision transformer for of- fline hindsight information matching","venue":null,"work_id":"2b6a3cf7-5a67-4e8a-969a-eae9901a0a07","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.154444Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:eef83e1b45b66a229b4ad4cca499ceb8f64f673ef140706d0ee4930b97f4f3d9","observation_id":"5655c842-202c-4de9-a6f0-f83ed89e05dd","resolution":{"observed_at":"2026-08-07T05:19:17.981506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.711559Z","title":"Act: empowering decision transformer with dynamic programming via advantage conditioning","venue":null,"work_id":"ba052e9d-14a1-4908-9e92-83ff1f7f8d86","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.328078Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ce5bbacfc56c258a0b4e9f848a71346959139e5cb3160c781726680377198448","observation_id":"e2aa48c5-3aa6-4a9d-95c2-bd9a5f79d2c2","resolution":{"observed_at":"2026-08-07T05:19:17.798842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T05:19:05.443153Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.443153Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:f21d31c6767a9fcb14de6ada1daa8905cded2f804f92c8655acd39455230a6b4","observation_id":"3269d05b-354c-48d7-afa8-da6aaa6f9c35","resolution":{"observed_at":"2026-08-07T05:19:05.443153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.503306Z","title":"Q-value regularized transformer for offline reinforcement learning","venue":null,"work_id":"a0a0f26c-c27c-4fe5-b310-7904dc69c515","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.597675Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ad9eb9123c7a2d6ec4b2de1643faa610fa586666a2d25a7baa085787cd480b8e","observation_id":"c368ab03-1013-4091-9e99-89f1c5170047","resolution":{"observed_at":"2026-08-07T05:19:17.590710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.286611Z","title":"Offline reinforcement learning as one big sequence modeling problem.Advances in neural information processing systems, 34:1273– 1286, 2021","venue":null,"work_id":"edf115dc-9554-4fbf-9610-d5df9881ed25","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.742356Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ed198f25d7ce0521adbcee898f77076af7c4cbf52013010211a96c4a36552bd9","observation_id":"01b99dd9-f6c6-4d7e-8696-ab0812b89bc3","resolution":{"observed_at":"2026-08-07T05:19:17.389293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:17.087694Z","title":"Is pessimism provably efficient for offline rl? In International Conference on Machine Learning, pages 5084–5096","venue":null,"work_id":"10cc0f21-16fc-411a-8243-178a2888e28f","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:05.905336Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:8b986bf81857525ec51702126637654bba8982b85089656c13698570d94e97f1","observation_id":"a250da26-9d7a-4fe9-8485-5e895f9eb332","resolution":{"observed_at":"2026-08-07T05:19:17.179796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.883566Z","title":"Reinforcement learning in robotics: A survey","venue":null,"work_id":"4f26e67a-c4a5-4134-b4b4-d5e9c81e824a","year":2013},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.058393Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:1508c809c158ce1f1e0bb18724ff810c88342c5a0ea69ee8094e115c04246784","observation_id":"7f6df767-4bcd-4739-8a4c-fab9b5d99d93","resolution":{"observed_at":"2026-08-07T05:19:16.979615Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.698927Z","title":"Quantile regression.Journal of economic perspectives, 15(4):143–156, 2001","venue":null,"work_id":"24daaae5-0651-4e5e-a11e-842f9483bb45","year":2001},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.236473Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:7959e9b74686ba475debc75814684b9b23e0a4ad79187eaf3f10bd11032892c8","observation_id":"cd59261a-7881-4ac4-bc9b-a754d3a0f442","resolution":{"observed_at":"2026-08-07T05:19:16.814473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.547057Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"c2c02de4-9213-4504-a39f-80338d5acdef","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.387415Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:fc10e758d563633bb2f3b49262d75d91222f37f2b9fb00e9ca7a2232d0ed0bfe","observation_id":"f822402f-8bc0-4912-83f8-edbe38a56fe4","resolution":{"observed_at":"2026-08-07T05:19:16.614230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.13465","last_updated":"2019-12-31T18:07:43Z","snapshot_observed_at":"2026-08-07T16:37:03.741931Z","submitted_at":"2019-12-31T18:07:43Z","title":"Reward-Conditioned Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.13465","snapshot_observed_at":"2026-08-07T05:19:06.527500Z","title":"Reward-conditioned policies.arXiv preprint arXiv:1912.13465, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.527500Z"},"links":{"cited_paper":"/paper/1912.13465","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:250869a73a87e49d9a3c6aca9446f3c57e8f8694330f65dfe5a2e68fccbb9f27","observation_id":"6c5875f2-64b1-4600-ae59-09958a242422","resolution":{"observed_at":"2026-08-07T05:19:06.527500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.328741Z","title":"Conservative q-learning for offline reinforcement learning.Advances in Neural Information Processing Systems, 33: 1179–1191, 2020","venue":null,"work_id":"92941f57-38c5-4458-98d8-a919f69d0b66","year":2020},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.681264Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:7f509c9c4ed19d29715a6cb4d3bff28d707cc6b9375bebab0818c7a320a7af5d","observation_id":"b8b33b93-0360-41c1-ae74-3d9cf32ad1c5","resolution":{"observed_at":"2026-08-07T05:19:16.417121Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-07T05:19:06.860433Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems.arXiv preprint arXiv:2005.01643, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:06.860433Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:277b6b051f96e6a30937d77db6a39ae4b8f2592a2dee272a0a2224e985e708ed","observation_id":"767bf042-42de-4d6b-abd8-08006375deda","resolution":{"observed_at":"2026-08-07T05:19:06.860433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:16.153146Z","title":"Deep rein- forcement learning for dynamic treatment regimes on medical registry data","venue":null,"work_id":"c33529ce-2f8f-4584-9852-4a2072fd2aa6","year":2017},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.000640Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:5f397f9360df48677b5ff2afc35b7ebb11a742db262febec9c5f37f2afacd5d3","observation_id":"2fe8ce3c-613d-4c92-9751-86e2c1fe269f","resolution":{"observed_at":"2026-08-07T05:19:16.248503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:15.960025Z","title":"Deep spatial q- learning for infectious disease control.Journal of Agricultural, Biological and Environmental Statistics, 28(4):749–773, 2023","venue":null,"work_id":"7d9e0ca3-54a0-4a5d-80c3-1ab4b9f9fe32","year":2023},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.146714Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:6b4d8c1d9886156c6e66cfc30cfc1f59d8a34b4ba10adf6218c3bf87dfed9f32","observation_id":"8858455d-b390-4bb0-acae-6186137f7915","resolution":{"observed_at":"2026-08-07T05:19:16.058975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:14.008123Z","title":"Human-level control through deep reinforcement learning.nature, 518(7540):529–533, 2015","venue":null,"work_id":"692c3435-aa12-4665-a033-3a50a29fc1ea","year":2015},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.322593Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:271e9d31686a443ca4176e786293dc4ce7af987117fc2498b23e6a2c12c992b1","observation_id":"9b0d61b0-f99f-49c0-a347-8858d116fba9","resolution":{"observed_at":"2026-08-07T05:19:15.881289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.814495Z","title":"Asymmetric least squares estimation and testing","venue":null,"work_id":"daf8b08e-a3fd-4f91-9005-7a926d76235d","year":1987},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.467721Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:13f6187bdc5426bf79a7c2be11af20f5329b4bedb217b564fc86adabea30f44f","observation_id":"be7d3c4b-a6ba-4257-915f-69937ccbad93","resolution":{"observed_at":"2026-08-07T05:19:13.905451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.637528Z","title":"You can’t count on luck: Why decision transformers and rvs fail in stochastic environments.Advances in neural information processing systems, 35:38966–38979, 2022","venue":null,"work_id":"a01fae47-74a5-4488-99eb-e602eb28f933","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.618289Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:9da7428fb4d90151dc7364b015c9106ed6c84a7fbaa0f65b0503bddd6b6ddb06","observation_id":"90b11ce6-50d2-4a37-b5d2-e924eca9d161","resolution":{"observed_at":"2026-08-07T05:19:13.732547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-06T05:45:23.347318Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-07T05:19:07.756599Z","title":"Reinforcement learning upside down: Don’t predict rewards–just map them to actions.arXiv preprint arXiv:1912.02875, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.756599Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:0365370e9093a58ea3d484cdb2858eba527893e8a049564051cbacffaf777d75","observation_id":"5717991e-91ec-4bfa-ba3a-df3a467f88cf","resolution":{"observed_at":"2026-08-07T05:19:07.756599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.479632Z","title":"Reinforcement learning in robotic applications: a comprehensive survey.Artificial Intelligence Review, 55(2):945–990, 2022","venue":null,"work_id":"daa73c30-e224-4dcd-881f-27d17b13ad2c","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:07.874637Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ad2b3729157ebf84fdd54f6de76e598ae30bb56e6b53abe5c43e93f2974413f5","observation_id":"1cca5d79-1339-4d7a-a4c9-664a40f50954","resolution":{"observed_at":"2026-08-07T05:19:13.536857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02877","last_updated":"2021-09-03T22:15:10Z","snapshot_observed_at":"2026-08-07T04:02:10.973662Z","submitted_at":"2019-12-05T21:13:36Z","title":"Training Agents using Upside-Down Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02877","snapshot_observed_at":"2026-08-07T05:19:08.014844Z","title":"Training agents using upside-down reinforcement learning.arXiv preprint arXiv:1912.02877, 2019","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.014844Z"},"links":{"cited_paper":"/paper/1912.02877","citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:5688dbfe763b32a19081cdfab913d29634d5995d47226210e2ce9cd41970e450","observation_id":"1e69c1d7-7926-44ab-b3ac-bb44ef679d6c","resolution":{"observed_at":"2026-08-07T05:19:08.014844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.283386Z","title":"MIT press,","venue":null,"work_id":"2e20aad0-8e03-4b88-8520-e7dbaad9edc1","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.194854Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:f1ded9e1a991e932920a9b308a481be8a863ad20b8e7a57dff33710140c6c5da","observation_id":"2afd2b9d-7214-4a41-9df1-ea4084ea1283","resolution":{"observed_at":"2026-08-07T05:19:13.380306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:13.084309Z","title":"Temporal difference learning and td-gammon.Communications of the ACM, 38(3):58–68, 1995","venue":null,"work_id":"bb8ad082-daa2-46e5-b97f-d00811817a49","year":1995},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.280991Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:e920b52b99dbcac30606b5ac00804004e5815646c9a4ff1a68a4b1dde208b4a3","observation_id":"721c7b5e-3a48-45fe-9077-1e0d3ef24a7a","resolution":{"observed_at":"2026-08-07T05:19:13.180697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.908798Z","title":"Grandmaster level in starcraft ii using multi-agent reinforcement learning.nature, 575(7782):350–354, 2019","venue":null,"work_id":"cb99db72-42ef-4e37-963e-ff45ba585ae3","year":2019},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.452464Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:00fb84917aafec48a16d662d6fd1c2d6840f800edb4ab7fb88ddf71e71eb65d7","observation_id":"87aa220a-a2ed-477e-a513-63bba5759d4e","resolution":{"observed_at":"2026-08-07T05:19:13.005163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:08.615517Z","title":"Return augmented decision transformer for off-dynamics reinforcement learning.arXiv preprint arXiv:2410.23450, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.615517Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:8b9aadfabf8973504db9feb9a7c113b0b43b021a09d16ee7213e95e19a675e3f","observation_id":"6141da23-8251-45f2-a0d1-7b5dbb5fea7e","resolution":{"observed_at":"2026-08-07T05:19:08.615517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.712162Z","title":"Q-learning.Machine learning, 8:279–292, 1992","venue":null,"work_id":"ca8dd677-4829-40ce-899c-acb7c8718bee","year":1992},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.701647Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:1dc15d580b7d2102cbbfb5910f600dbdeec72dfcb1d85e32dd3caaf3db7f4120","observation_id":"ff035164-e227-4e2b-a65f-8cbc31daef0d","resolution":{"observed_at":"2026-08-07T05:19:12.809949Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.507465Z","title":"Elastic decision transformer.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"4310f7d6-e14e-4202-b04c-37ea12a24b96","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:08.859217Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ae7dbe37d2499f7d0ec4428d81d110f661229fbd707ef2261df3734097ee95bf","observation_id":"53389b36-65f8-4b59-9e7f-1c542c47ee22","resolution":{"observed_at":"2026-08-07T05:19:12.608655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.312185Z","title":"A policy-guided imitation approach for offline reinforcement learning.Advances in neural information processing systems, 35: 4085–4098, 2022","venue":null,"work_id":"7271ea8d-8ac8-4565-9648-59e6efda5824","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.061745Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:f7ae46794177d0c2e86f502b4bef68c6be898e568f04f8ccb66b00e62fb018a1","observation_id":"c631914c-ae8a-4a8d-9b28-261d8d59acbb","resolution":{"observed_at":"2026-08-07T05:19:12.409417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:12.158265Z","title":"Q-learning decision transformer: Leveraging dynamic programming for conditional sequence modelling in offline rl","venue":null,"work_id":"95bd31a7-5362-4f34-b5c8-ee89b83785c0","year":2023},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.142012Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:bc778cbd18d75c4dc126b06c99f9bc1461944fcb963544f350bcf50b97430f54","observation_id":"f7854296-a476-4262-841e-cfb35771bd49","resolution":{"observed_at":"2026-08-07T05:19:12.219928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.999475Z","title":"Dichotomy of control: Sepa- rating what you can control from what you cannot","venue":null,"work_id":"b7e8b6cf-8a33-4a06-ad49-94ccca22bfe5","year":2023},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.297843Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:b8810a8bb72677f6f0b60971c526334e92a8660d89177a336370d3fe6ab32c5c","observation_id":"43b19276-ba88-4e84-8dcb-7e19465c5716","resolution":{"observed_at":"2026-08-07T05:19:12.062449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.803978Z","title":"Reinforcement learning in healthcare: A survey.ACM Computing Surveys (CSUR), 55(1):1–36, 2021","venue":null,"work_id":"b145e650-dc42-45b6-8537-058a5463a374","year":2021},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.413750Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:0427868f1b97e3fa0ce8a0dd953e98fa116e15c49d6dd71ea72ae62e1cf6650b","observation_id":"a50769dc-a148-47b9-9a8a-774bd96bf1c9","resolution":{"observed_at":"2026-08-07T05:19:11.895118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.631918Z","title":"Online decision transformer","venue":null,"work_id":"ecb82392-626b-4d56-b692-843908744482","year":2022},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.528698Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:7221faa4287d8c4b3f1404a2b22d826e33d28b9c5ccb46519dd17aa4c96bc0a6","observation_id":"0b35ec78-9d8d-40d5-bf81-1186ecea1ed2","resolution":{"observed_at":"2026-08-07T05:19:11.717619Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.448575Z","title":"How does goal relabeling improve sample efficiency? InProceedings of the 41st International Conference on Machine Learning, pages 61246–61266","venue":null,"work_id":"f5cdc140-754a-44fc-b06d-b2b3789f7581","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.716896Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:79d835ece427780b5a6895f383f58c31166e49b9501353619d7371e81813b9d0","observation_id":"544670a7-2e87-4095-8ce6-248819a8584e","resolution":{"observed_at":"2026-08-07T05:19:11.514778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.222050Z","title":null,"venue":null,"work_id":"9b9f4fcc-b662-4fa9-bec3-6b9ddf00bad8","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.811315Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ace5ac46737fad432dc8a27f41f32276bbcbd76981cc617dddee4fe625a97b8d","observation_id":"77d681dd-db1b-4cca-95f7-8e794631c989","resolution":{"observed_at":"2026-08-07T05:19:11.309789Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:11.018148Z","title":"Reinformer: Max- return sequence modeling for offline rl","venue":null,"work_id":"cb40248f-3794-4a10-9217-323a3f258774","year":2024},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:09.935960Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:ba6b9b63cae5b84d55db4f01ec39c22653690981cc96f930ecb1adf4218a55c1","observation_id":"496aea22-1320-433e-a1cb-28b8a0d6fb68","resolution":{"observed_at":"2026-08-07T05:19:11.115470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:10.825856Z","title":"Starting from the second stage, π⋆ starts stitching the performance of different trajectories","venue":null,"work_id":"092aa749-8efe-4911-9920-974c185bbc3c","year":2000},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.095418Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:f1349d8bbd8f01785f1f3be117ae9462e69abd73274d60c5b4c420bbbf09f983","observation_id":"55a97671-7fdc-4e24-9518-930d3c5a772d","resolution":{"observed_at":"2026-08-07T05:19:10.911021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:10.587384Z","title":"We formulate the loss function as LDT−R 2CSL =E τ [−logπ θ(·|τ)−λH(π θ(·|τ))]","venue":null,"work_id":"10e9ae20-b5bf-49b2-897f-53fabd5d209c","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:10.275156Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:10b2f14749b88d949b0694b98df8e51139251fd073342d6b16103fe960d0ceee","observation_id":"cd6d66ec-ab1a-41b8-a2fb-2b6f7c8dac22","resolution":{"observed_at":"2026-08-07T05:19:10.716042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:19:18.439182Z","title":null,"venue":null,"work_id":"b28d7943-e81e-488f-9c42-1894e4171891","year":null},"citing_paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T05:19:04.464264Z"},"links":{"citing_paper":"/paper/2506.08463"},"observation_digest":"sha256:df9674a893327ed18ccbc219b940eefdcb2637403fc69ae6111fffffd91453d2","observation_id":"da474c82-2cbc-41c7-847d-50e88d987a07","resolution":{"observed_at":"2026-08-07T05:19:18.566541Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08463","last_updated":"2025-06-10T05:37:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T05:08:02.190467Z","submitted_at":"2025-06-10T05:37:51Z","title":"How to Provably Improve Return Conditioned Supervised Learning?"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":8,"verified_exact":0,"verified_fuzzy":34},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.08463."}