{"as_of":"2026-08-07T17:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e715cff5cc8dacef54474d5e89780c0ccd1eca8a00b6307d920eee48857f2c6d","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":34,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":34,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":34,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:00:06.317779Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:17:36.875832Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-07T05:00:06.317779Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09276","last_updated":"2026-07-07T00:07:34Z","snapshot_observed_at":"2026-08-07T04:50:05.176428Z","submitted_at":"2025-06-10T22:27:11Z","title":"Learning The Minimum Action Distance","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T05:00:06.317779Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2506.09276"},"observation_digest":"sha256:bec978e901ab5b177e1a3d9d430397ea1b69a6635a910f9d4b24c8be486e1ceb","observation_id":"ddd076b9-b87d-41cc-8f01-81939b16a6cf","resolution":{"observed_at":"2026-08-07T05:00:06.317779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2506.15799","last_updated":"2025-06-25T19:09:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-18T18:35:57Z","title":"Steering Your Diffusion Policy with Latent Space Reinforcement Learning","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-17T21:55:46.183007Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2506.15799"},"observation_digest":"sha256:f89bba348c730e614063f0933c3238f666683b4deb940792c2d971b340391912","observation_id":"36b8ca25-01b5-4335-ae96-44d416abfe1e","resolution":{"observed_at":"2026-05-17T21:55:46.344748Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2507.07969","last_updated":"2026-05-11T17:12:21Z","snapshot_observed_at":"2026-07-06T21:55:17.277337Z","submitted_at":"2025-07-10T17:48:03Z","title":"Reinforcement Learning with Action Chunking","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-19T05:18:20.960945Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2507.07969"},"observation_digest":"sha256:7f003e1375406f76e8008f405bd2dfe86f79d884f316acfc10a13d2f3e9b4175","observation_id":"6dff9391-b094-4459-a603-a585e27a868f","resolution":{"observed_at":"2026-05-19T05:22:06.454680Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-06T11:03:27.866008Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.23172","last_updated":"2025-08-01T01:21:35Z","snapshot_observed_at":"2026-08-06T19:28:36.018078Z","submitted_at":"2025-07-31T00:52:05Z","title":"Benchmarking Massively Parallelized Multi-Task Reinforcement Learning for Robotics Tasks","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T11:03:27.866008Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2507.23172"},"observation_digest":"sha256:5c40007531513bb82b7b1774213d05b6b7fd9511976594057822e0ca93d6f3ee","observation_id":"94b606da-e505-4439-a907-8aea010ac98d","resolution":{"observed_at":"2026-08-06T11:03:27.866008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-04T11:01:32.940364Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.07650","last_updated":"2026-05-30T05:26:12Z","snapshot_observed_at":"2026-08-04T11:01:21.243413Z","submitted_at":"2025-10-09T00:57:40Z","title":"Value Flows","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-04T11:01:32.940364Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2510.07650"},"observation_digest":"sha256:72e4ab6049ee25c4f89ea1b8c1d13f17f91412b14d9328732bddbf5703fb63ce","observation_id":"d9dbfc70-990c-4916-9fce-9c40718e0fdd","resolution":{"observed_at":"2026-08-04T11:01:32.940364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-03T13:13:46.181719Z","title":"Ogbench: Benchmark- ing offline goal-conditioned rl.arXiv preprint arXiv:2410.20092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.00126","last_updated":"2026-07-17T22:35:37Z","snapshot_observed_at":"2026-08-07T13:27:14.079828Z","submitted_at":"2025-12-31T22:03:19Z","title":"Compositional Diffusion with Guided Search for Long-Horizon Planning","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T13:13:46.181719Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2601.00126"},"observation_digest":"sha256:335397129c048258d30797de90330acc949334b81ab13d9394bd56aaa35d7729","observation_id":"fa05d691-ee30-48d1-bca9-55001b0cf89d","resolution":{"observed_at":"2026-08-03T13:13:46.181719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T03:36:09.272019Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:ea4937c83e475d77b2e215f3727708d440985a34c6eff6d083dd39e493bfe633","observation_id":"db0b3ea9-b2d5-4412-942a-55295afb2f63","resolution":{"observed_at":"2026-05-16T03:37:13.925570Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-03T02:55:50.664859Z","title":"Ogbench: Benchmarking offline goal- conditioned rl.arXiv preprint arXiv:2410.20092, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.09580","last_updated":"2026-06-05T16:14:20Z","snapshot_observed_at":"2026-08-03T02:53:08.103634Z","submitted_at":"2026-02-10T09:28:20Z","title":"SERNF: Sample-Efficient Real-World Dexterous Policy Fine-Tuning via Action-Chunked Critics and Normalizing Flows","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T02:55:50.664859Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.09580"},"observation_digest":"sha256:2f645d7d52302ff2b73ecf830eb8ba401574f8866cb25ef2887661a7ec03e2b5","observation_id":"51faad8d-45e9-4094-90c7-8d8b21cb8b97","resolution":{"observed_at":"2026-08-03T02:55:50.664859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-02T20:29:21.761975Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23280","last_updated":"2026-05-29T16:05:00Z","snapshot_observed_at":"2026-08-02T20:29:16.307639Z","submitted_at":"2026-02-26T17:53:46Z","title":"Mollified Value Learning","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T20:29:21.761975Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2602.23280"},"observation_digest":"sha256:6974ba944d43f5d0832fd1e087ee59833079300e832faf045f4d2aadc6bbcd8c","observation_id":"a8343163-33b9-4f8f-862e-8bfb86baf7ce","resolution":{"observed_at":"2026-08-02T20:29:21.761975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.03208","last_updated":"2026-06-16T20:46:31Z","snapshot_observed_at":"2026-07-13T13:29:04.173053Z","submitted_at":"2026-04-03T17:32:36Z","title":"Hierarchical Planning with Latent World Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-13T20:13:58.991298Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.03208"},"observation_digest":"sha256:4621abbf3b8877b373c851e01d13a35dc19c83e213c0150b5d3840b23ca55b9e","observation_id":"f9df1c76-1628-4832-a185-ad2f45d46095","resolution":{"observed_at":"2026-05-13T20:18:13.774657Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.08960","last_updated":"2026-04-10T05:04:29Z","snapshot_observed_at":"2026-07-06T22:57:59.555972Z","submitted_at":"2026-04-10T05:04:29Z","title":"Efficient Hierarchical Implicit Flow Q-learning for Offline Goal-conditioned Reinforcement Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T18:12:32.839681Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.08960"},"observation_digest":"sha256:bfa44138ac8a1895120813b5567798e5fc5cfbc500e19cccd93c31718f196211","observation_id":"91efc267-0bc1-469c-b6cb-d890ec779898","resolution":{"observed_at":"2026-05-11T05:20:58.759408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.17919","last_updated":"2026-05-05T15:00:45Z","snapshot_observed_at":"2026-07-06T23:04:55.190916Z","submitted_at":"2026-04-20T07:54:36Z","title":"Fisher Decorator: Refining Flow Policy via a Local Transport Map","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T05:28:12.298066Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.17919"},"observation_digest":"sha256:8ac08dee73578c42d0e402493df43490db15f4941e92c1b2bc0b7cf210e24312","observation_id":"5d64e35e-d665-4b71-82a6-b355254c28fd","resolution":{"observed_at":"2026-05-10T06:51:46.552771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.20627","last_updated":"2026-04-22T14:41:56Z","snapshot_observed_at":"2026-08-01T22:57:29.770019Z","submitted_at":"2026-04-22T14:41:56Z","title":"Occupancy Reward Shaping: Improving Credit Assignment for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T00:19:48.053466Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.20627"},"observation_digest":"sha256:943a7693535a4d4b5c50f8f21d100e3e8b4eff0c90b4a37d1820836de1f2decc","observation_id":"52b4f72d-a89e-4d2c-b643-2cc6aaad9b70","resolution":{"observed_at":"2026-05-10T00:24:47.205459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2604.24729","last_updated":"2026-04-27T17:40:18Z","snapshot_observed_at":"2026-07-06T23:10:42.926677Z","submitted_at":"2026-04-27T17:40:18Z","title":"SpecRLBench: A Benchmark for Generalization in Specification-Guided Reinforcement Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:01:31.928056Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2604.24729"},"observation_digest":"sha256:7ad84d4276dd9ea6fd092b13fd6baec07d942ad4bfc7b41ac1ce9fa15ecdc170","observation_id":"f7c41406-3076-4c03-9255-6e26d1176723","resolution":{"observed_at":"2026-05-11T21:51:30.956553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-09T20:30:51.580075Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:cb3aaaab9baaf24edd444fb30d25a01ddcef88d26fff2700ce847b975280a306","observation_id":"16424fe2-24bc-442f-a9c2-c627f70a1b1c","resolution":{"observed_at":"2026-05-11T15:11:06.863014Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.00333","last_updated":"2026-05-18T20:20:23Z","snapshot_observed_at":"2026-08-02T02:43:02.274304Z","submitted_at":"2026-05-01T01:23:37Z","title":"Borrowed Geometry: Cross-Distribution Head-Importance Fingerprints of Frozen Pretrained Gemma 4 31B","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T00:26:22.118037Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.00333"},"observation_digest":"sha256:9f0b4235d5118bd0f7be70934e155757f76678443e5f16b565fc0cf4bc79d5cd","observation_id":"300624e1-04bc-4ec4-87c6-edc248d7fa68","resolution":{"observed_at":"2026-05-21T00:29:17.301394Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.01663","last_updated":"2026-05-28T02:21:27Z","snapshot_observed_at":"2026-07-06T23:14:52.417213Z","submitted_at":"2026-05-03T01:32:11Z","title":"Towards Efficient and Expressive Offline RL via Flow-Anchored Noise-conditioned Q-Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T16:25:25.739019Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.01663"},"observation_digest":"sha256:83218d2effbc492b96daedcd0ef2a44ad060116637b8868be285d4f8c75d5564","observation_id":"9466608c-1199-4497-a4b2-077d4b95e77b","resolution":{"observed_at":"2026-05-11T08:56:00.606269Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-08T11:20:19.749415Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:63ba29e4edc9975efbfc559a0900a68bc4fd53c46ce996e60e8ae1e8a33a5132","observation_id":"c88c5716-39f9-4a42-b98f-974e35ff1918","resolution":{"observed_at":"2026-05-11T19:41:07.982348Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.05812","last_updated":"2026-05-11T14:20:38Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T07:47:55Z","title":"Long-Horizon Q-Learning: Accurate Value Learning via n-Step Inequalities","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T05:05:29.984355Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.05812"},"observation_digest":"sha256:9a5247eb0e7097e342210d2a45496a994bac84b5e4573eb25e85ff074d0e0a16","observation_id":"6857293c-88d8-4b70-80b9-0634613f7325","resolution":{"observed_at":"2026-05-12T05:41:24.574346Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.07278","last_updated":"2026-05-08T05:43:33Z","snapshot_observed_at":"2026-08-01T00:55:28.214005Z","submitted_at":"2026-05-08T05:43:33Z","title":"Predictive but Not Plannable: RC-aux for Latent World Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-11T02:11:26.526418Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.07278"},"observation_digest":"sha256:81fbcbe94cf5db7b50049c30a0276b58bdba2c3d76a96e3dee23ec7d5b2dacc8","observation_id":"c98f6020-6a6c-44eb-b2a3-6e0cdc916f31","resolution":{"observed_at":"2026-05-11T03:50:57.287755Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.09364","last_updated":"2026-05-10T06:27:20Z","snapshot_observed_at":"2026-07-31T06:28:20.350355Z","submitted_at":"2026-05-10T06:27:20Z","title":"Multi-scale Predictive Representations for Goal-conditioned Reinforcement Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T03:35:37.739085Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.09364"},"observation_digest":"sha256:f68a21f7ba412e4807281de52100dd68f87c5cdf10fcce022c4a743284014e53","observation_id":"e418e201-bd0b-4a2d-a6d1-0865b173542e","resolution":{"observed_at":"2026-05-12T07:16:26.099173Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.12416","last_updated":"2026-05-12T17:12:29Z","snapshot_observed_at":"2026-07-06T23:24:08.763444Z","submitted_at":"2026-05-12T17:12:29Z","title":"Aligning Flow Map Policies with Optimal Q-Guidance","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T05:04:22.603786Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.12416"},"observation_digest":"sha256:95331ce256c6f3858bdac6cc9009ffaa06a41e1873e011ea7afff9e697a71e7c","observation_id":"3314f778-70a6-4826-b3a6-9ec994936505","resolution":{"observed_at":"2026-05-13T05:07:17.404995Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.13554","last_updated":"2026-05-13T13:58:49Z","snapshot_observed_at":"2026-08-01T19:52:28.213526Z","submitted_at":"2026-05-13T13:58:49Z","title":"Self-Supervised On-Policy Reinforcement Learning via Contrastive Proximal Policy Optimisation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T20:12:07.920183Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.13554"},"observation_digest":"sha256:ed3428cf3f35ebbb54dbe8b5293bde515543caab4675aff23212ed26bee0870f","observation_id":"08f062bb-30cb-429b-8b2a-aaa02d3ea330","resolution":{"observed_at":"2026-05-14T20:12:55.160986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.22711","last_updated":"2026-05-21T16:50:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:50:26Z","title":"Abstraction for Offline Goal-Conditioned Reinforcement Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:46:20.289421Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.22711"},"observation_digest":"sha256:2487d7e0450785133a844bef5857355ba925d9bcfe52995923b7f67c9f3fe3b7","observation_id":"68eaf269-05be-4142-b8dd-52ae9d8b9432","resolution":{"observed_at":"2026-05-22T07:51:16.424773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2605.23551","last_updated":"2026-05-22T12:17:09Z","snapshot_observed_at":"2026-07-06T23:33:44.335185Z","submitted_at":"2026-05-22T12:17:09Z","title":"Goal-Conditioned Agents that Learn Everything All at Once","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-25T04:59:48.867927Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2605.23551"},"observation_digest":"sha256:f379a4eb39d96f9e678c9f82f35fd92da0734ec7ee37a167f9243805d464994d","observation_id":"ae08cfba-9d06-4283-8e67-ce8456143eb3","resolution":{"observed_at":"2026-05-25T05:00:21.633420Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":"2410.20092","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-03T04:17:36.875832Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":"f84e0fbd-005f-4e9d-9d5f-4c39b8222a5d","year":2024},"citing_paper":{"arxiv_id":"2606.11087","last_updated":"2026-06-09T16:45:57Z","snapshot_observed_at":"2026-08-02T20:45:09.177143Z","submitted_at":"2026-06-09T16:45:57Z","title":"Test-Time Gradient Guidance of Flow Policies in Reinforcement Learning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-27T14:05:01.073951Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2606.11087"},"observation_digest":"sha256:f4096776b510a2d520b205b1d5b84a4bc86e45f2139539755f636dea9e851511","observation_id":"3d2b2bbc-1993-411f-a147-1022ad6c4c7b","resolution":{"observed_at":"2026-07-03T04:17:36.877597Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-11T10:36:56.968032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04978","last_updated":"2026-07-06T12:12:50Z","snapshot_observed_at":"2026-07-11T10:36:56.412676Z","submitted_at":"2026-07-06T12:12:50Z","title":"Qantara: Bridge-Flow Training for Multi-Paradigm JEPA Control","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T10:36:56.968032Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.04978"},"observation_digest":"sha256:9e698c262d3e987c9119841817edc38667e4ce766aeaf26ee9061ceb6687c5eb","observation_id":"eaff6284-3a5b-4e89-951c-191532220092","resolution":{"observed_at":"2026-07-11T10:36:56.968032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-01T16:35:02.963644Z","title":"arXiv preprint arXiv:2410.20092 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.17981","last_updated":"2026-07-20T14:15:03Z","snapshot_observed_at":"2026-08-07T06:41:03.058424Z","submitted_at":"2026-07-20T14:15:03Z","title":"Information-Based Exploration via Random Features for Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T16:35:02.963644Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.17981"},"observation_digest":"sha256:ab145f48c4efdea9c93b7f997fc606dc346ff84e76b847fd8f32608e8e3105a1","observation_id":"bc458cce-5a2c-491f-8fa9-397615687046","resolution":{"observed_at":"2026-08-01T16:35:02.963644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-01T15:40:56.214865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18236","last_updated":"2026-07-20T17:59:41Z","snapshot_observed_at":"2026-08-06T03:29:10.545879Z","submitted_at":"2026-07-20T17:59:41Z","title":"Patch Policy: Efficient Embodied Control via Dense Visual Representations","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-01T15:40:56.214865Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.18236"},"observation_digest":"sha256:ede17f7796c8ffff27cd41eb1562b78ea9fe3ba9121150cf94c214bbf1d7ff69","observation_id":"a760df6e-d248-44ab-bf5f-74b9f08d95af","resolution":{"observed_at":"2026-08-01T15:40:56.214865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-30T17:53:36.995307Z","title":"Arjun Parthasarathy, Nimit Kalra, Rohun Agrawal, Yann Le- Cun, Oumayma Bounou, Pavel Izmailov, and Micah Gold- blum","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23602","last_updated":"2026-07-26T11:11:23Z","snapshot_observed_at":"2026-08-05T10:42:24.747043Z","submitted_at":"2026-07-26T11:11:23Z","title":"Action from Adjacent Set in Physical Space Outperforms the Best Prediction in World Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-30T17:53:36.995307Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.23602"},"observation_digest":"sha256:a1fa66794b93d59840202ad48e3559a5ea400785d9c6b0fc7cb567d293b87bad","observation_id":"dc080992-ec57-4d70-9d2d-b5d554fe735b","resolution":{"observed_at":"2026-07-30T17:53:36.995307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-01T03:05:32.205627Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.25236","last_updated":"2026-07-28T03:23:47Z","snapshot_observed_at":"2026-08-07T03:53:36.042533Z","submitted_at":"2026-07-28T03:23:47Z","title":"VisualPatchWorld: Code World Models as Latent Structured Representations for Planning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T03:05:32.205627Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.25236"},"observation_digest":"sha256:b829347bb850195f8eeb994b1f481558261fee2950ccfcb49731c407ab77c6ff","observation_id":"43b47a63-4c4c-47c9-8f6c-814b4fa5ef8e","resolution":{"observed_at":"2026-08-01T03:05:32.205627Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-30T11:06:23.418816Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T17:18:01.416833Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-07-30T11:06:23.418816Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:2dc9e55b4f46d6a71dfc91cfe0f0d2c8aab1d748815bec26e5d2b369e62bac5f","observation_id":"1f3ce3a4-1cc5-4edc-956c-e0696890dc7f","resolution":{"observed_at":"2026-07-30T11:06:23.418816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-08-05T04:27:43.918926Z","title":"Ogbench: Benchmarking offline goal-conditioned rl, 2025 a","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27203","last_updated":"2026-08-03T21:04:51Z","snapshot_observed_at":"2026-08-07T17:18:01.416833Z","submitted_at":"2026-07-29T17:59:51Z","title":"Do You Really Need to Pretrain Q-Functions for Online RL Fine-Tuning?","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T04:27:43.918926Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27203"},"observation_digest":"sha256:ba6c145db275198dcd4877527a0f1cf4e2276d640a999429138680e93dfaecd4","observation_id":"59243467-6b8b-404f-be6d-410361a58dae","resolution":{"observed_at":"2026-08-05T04:27:43.918926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.20092","snapshot_observed_at":"2026-07-31T01:24:21.144653Z","title":"OGBench : Benchmarking offline goal-conditioned RL","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27422","last_updated":"2026-07-29T19:43:40Z","snapshot_observed_at":"2026-08-04T18:59:28.394917Z","submitted_at":"2026-07-29T19:43:40Z","title":"Good Rankers, Bad Objectives: Bilinear Contrastive Critics under Expressive Policy Search","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-31T01:24:21.144653Z"},"links":{"cited_paper":"/paper/2410.20092","citing_paper":"/paper/2607.27422"},"observation_digest":"sha256:eb6de918b0c8bf54da0c659f51ec8eed7984925836e5b0769277067454f6f92f","observation_id":"f6166a98-0e4f-4829-abdf-68c99f0d7fc2","resolution":{"observed_at":"2026-07-31T01:24:21.144653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.20092/citation-record","integrity":"/paper/2410.20092/integrity","json":"/paper/2410.20092/citation-record.json","paper":"/paper/2410.20092"},"outbound":[],"paper":{"arxiv_id":"2410.20092","last_updated":"2025-02-13T18:38:13Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T19:40:04.428123Z","submitted_at":"2024-10-26T06:06:08Z","title":"OGBench: Benchmarking Offline Goal-Conditioned RL"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 34 inbound Pith citation observations for arXiv:2410.20092."}