{"as_of":"2026-08-18T04:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3973d4f9ed87f604c818bbbecd43194352aa4214326361204c1748e5fd0c5504","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-10T16:39:10.354308Z","state":"measured"},{"denominator":58,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":58,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:15:52.407616Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.07855","snapshot_observed_at":"2026-08-02T04:15:52.407616Z","title":"Nftr: From provable mode-averaging to geodesic subgoal selection in offline goal-conditioned rl.arXiv preprint arXiv:2607.07855,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13731","last_updated":"2026-07-15T11:45:31Z","snapshot_observed_at":"2026-08-06T11:06:46.721880Z","submitted_at":"2026-07-15T11:45:31Z","title":"DAGR: State-Conditioned Goal Representations via Difference-Aware Goal Cross-Attention","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-02T04:15:52.407616Z"},"links":{"cited_paper":"/paper/2607.07855","citing_paper":"/paper/2607.13731"},"observation_digest":"sha256:5554a3653c369f2f83b47aca2580b5d6a4985bb75df6cd16d024fa5d66585cd7","observation_id":"8a9a3960-da33-4586-a473-ad6e4c61c817","resolution":{"observed_at":"2026-08-02T04:15:52.407616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.07855/citation-record","integrity":"/paper/2607.07855/integrity","json":"/paper/2607.07855/citation-record.json","paper":"/paper/2607.07855"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12737","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.445392Z","title":"Option-aware temporally abstracted value for offline goal-conditioned reinforcement learning","venue":null,"work_id":"262685e5-c397-4484-b255-ffb30545579c","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:4174fe798ef4daf5f73332653574ba44f9658cb8a6233a2e104cadcd7f72f860","observation_id":"a1f560ea-b84a-4e16-88d3-bd6708dbc0f3","resolution":{"observed_at":"2026-07-10T16:47:24.447006Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.785271Z","title":"Let offline RL flow: Training conservative agents in the latent space of normalizing flows","venue":null,"work_id":"83d1c876-c936-432b-b71a-2d135b4859ff","year":2022},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:7779edf33a6d33701d428d68858371559416429a6e407587a4adf8029d0f85f9","observation_id":"d4be5774-c99d-4413-b3b9-0b6f58dbc2df","resolution":{"observed_at":"2026-07-10T16:47:24.786980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.792795Z","title":"Hindsight experience replay","venue":null,"work_id":"c268d60f-8e57-4d19-be54-6808078d2fe3","year":2017},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:981520daedbb69229697e69f74ff298288c64ecf54b2e93b5ec55776cb1e292a","observation_id":"fce20aff-8b51-4315-84a9-4f6b4db921d5","resolution":{"observed_at":"2026-07-10T16:47:24.794348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.781278Z","title":"Graph-assisted stitching for offline hierarchical reinforcement learning","venue":null,"work_id":"5cacab50-a897-4f4a-8a6a-00c73fa8f9ca","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:aac4ca940d01a41891cb277937224e2986098898b2e48b8ac2c675bd0d1f1cbb","observation_id":"9dc671b4-8ff8-48bc-a8b2-c9e199810a01","resolution":{"observed_at":"2026-07-10T16:47:24.782508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.783202Z","title":"Test-time offline reinforcement learning on goal-related experience","venue":null,"work_id":"ed083bce-ffb6-4ec2-b13f-9493e3ba5a0f","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:2bb3bbe28ff9172f99916459fa4f795e149f9ee7c882cf4635f4aa43b9c010c4","observation_id":"2c1c59ce-c563-4f9c-97ae-1cd92da5cf6e","resolution":{"observed_at":"2026-07-10T16:47:24.784706Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.812955Z","title":"Flowpg: action-constrained policy gradient with normalizing flows.Advances in Neural Information Processing Systems, 36:20118–20132","venue":null,"work_id":"eccd3379-62e4-44c6-8c02-7d6f02c0998c","year":2023},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:f1c3f79fc57819ae6921e15195508ff101573c936a894fc3b92186ae7936ad29","observation_id":"1790222e-ff88-47b5-9318-fc931e3d15fe","resolution":{"observed_at":"2026-07-10T16:47:24.814651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.795086Z","title":"Maximum entropy reinforcement learning via energy-based normalizing flow.Advances in Neural Information Processing Systems, 37:56136–56165, 2024","venue":null,"work_id":"8bac51ac-a406-437f-9abd-e8de691c699e","year":2024},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:613983f3ab1c716885cb25d9abdfc2d9a691af4afbf777c012856596dfc52ad8","observation_id":"63602eeb-a32e-435b-9602-9c720e090ebe","resolution":{"observed_at":"2026-07-10T16:47:24.796704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1410.8516","last_updated":"2015-04-10T12:27:56Z","snapshot_observed_at":"2026-08-12T12:07:47.951486Z","submitted_at":"2014-10-30T19:44:20Z","title":"NICE: Non-linear Independent Components Estimation","version":6},"cited_work":{"arxiv_id":"1410.8516","doi":"10.48550/arxiv.1410.8516","metadata_source":"pith","pith_arxiv_id":"1410.8516","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"NICE: Non-linear Independent Components Estimation","venue":"cs.LG","work_id":"47bfe556-ce63-4e62-b810-488f772bcb82","year":2014},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/1410.8516","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:e01ecbceec43c57abe928fb0ed02d521c4ea3ffd3a5126e311f27c906e14b01e","observation_id":"76551841-f9cf-482b-9d5c-bb2ea89eabec","resolution":{"observed_at":"2026-07-10T16:47:24.446897Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-05-20T21:54:01.775763+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T21:54:01.775763+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.831385Z","title":"Density estimation using real NVP","venue":null,"work_id":"9b77bfdf-b8ee-4084-917e-3436d7619e01","year":2017},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:f4762fbe2ba069c00f367ab3d04a52e718ec3f00adcfdb04f4a94397130c7f90","observation_id":"eda767ff-090b-44a0-a44d-1922026a0618","resolution":{"observed_at":"2026-07-10T16:47:24.832686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.854662Z","title":"Inference via interpolation: Contrastive representations provably enable planning and inference.Advances in Neural Information Processing Systems, 37:58901–58928, 2025","venue":null,"work_id":"01b2e77c-d4d0-484f-8a3c-ec51b2e3a969","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:6f5894049505ed1d6901d6dad5ee76f291d016eecf355de8730642cd157628fc","observation_id":"1fcabc6e-5df7-4320-a04b-cbb1c354431e","resolution":{"observed_at":"2026-07-10T16:47:24.855972Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.852513Z","title":"Contrastive learning as goal-conditioned reinforcement learning.Advances in Neural Information Processing Systems, 35:35603– 35620, 2022","venue":null,"work_id":"82c8d375-d60d-4100-9f54-a08e5b7ff590","year":2022},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:604589d69d08e907f3d7e0ed65133da97fc11249d51a6426cfa3765999c2fb92","observation_id":"3d58bd92-2834-4b98-8f86-b6f91dcedbcd","resolution":{"observed_at":"2026-07-10T16:47:24.853939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23527","last_updated":"2026-06-25T14:27:54Z","snapshot_observed_at":"2026-08-17T20:03:08.072659Z","submitted_at":"2025-05-29T15:06:22Z","title":"Normalizing Flows are Capable Models for Continuous Control","version":4},"cited_work":{"arxiv_id":"2505.23527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23527","snapshot_observed_at":"2026-07-10T16:47:24.460507Z","title":"Normalizing flows are capable models for RL.CoRR, abs/2505.23527","venue":"cs.LG","work_id":"ef052b56-b104-4b49-a646-2704d7c7d2ca","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2505.23527","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:58e7b80ac33357d3227c6b4a92e2e6b7715e64a2eb75e8494460941788034115","observation_id":"39c36489-9210-4231-a26f-b2c8ca5746a8","resolution":{"observed_at":"2026-07-10T16:47:24.462029Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.06782","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.463157Z","title":"Physics-informed value learner for offline goal-conditioned reinforcement learning.arXiv preprint arXiv:2509.06782, 2025","venue":null,"work_id":"12365cde-d8d4-4697-97fd-d675c6e5f9e3","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:e15ccde509fc46a3d59c47ac36d8e230eb0e3d37b816a434917390b465a4452f","observation_id":"242702d1-010e-4643-8d22-4a1e8561a49c","resolution":{"observed_at":"2026-07-10T16:47:24.464996Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.852883Z","title":"Hierarchical entity- centric reinforcement learning with factored subgoal diffusion","venue":null,"work_id":"9326468d-d9b5-4515-9fe1-6c6810bc2fae","year":2026},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:2293982380a346d4af5a19dbfd5d144c9b748a524938f5cd94014b965d8a1d45","observation_id":"22a34649-58e6-475c-8033-d93cb4df91da","resolution":{"observed_at":"2026-07-10T16:47:24.854139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.858523Z","title":"Diffused task-agnostic milestone planner.Advances in Neural Information Processing Systems, 36:387–405, 2023","venue":null,"work_id":"12e6eaa0-ee0e-4e2e-9c25-13ec9e25d5fe","year":2023},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:07e54d798a83c5e6778ff0da22ee9a1a449b3aefc63bbc0bc43b7bd5533ccf96","observation_id":"defb4118-cf24-4249-aa4a-3916073cda9a","resolution":{"observed_at":"2026-07-10T16:47:24.859775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.842336Z","title":"Learning to reach goals via diffusion","venue":null,"work_id":"77476def-b76a-43fd-bc09-7f4977211d1b","year":2024},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:a00292f2537a2c4c7f14a20b3eb35c92fa7aeceeb337a255e83d08869c25aa41","observation_id":"67740f3d-7a17-4a7e-8736-e0b1696b0b52","resolution":{"observed_at":"2026-07-10T16:47:24.843607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.842762Z","title":"Conservative offline goal-conditioned implicit V-learning","venue":null,"work_id":"33769d72-cedb-4d92-bb81-82bf4fc8b28a","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:5057500c2e2bc3b139808d9c69f0cf925aaf03df940e644b373dbb018c542f55","observation_id":"bef3d8e2-8000-435b-8d13-6bb3bacd1d9d","resolution":{"observed_at":"2026-07-10T16:47:24.844113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.839041Z","title":"Glow: Generative flow with invertible 1x1 convolutions.Advances in neural information processing systems, 31","venue":null,"work_id":"436e7e46-de13-4d15-9dd0-b1ead14e9892","year":2018},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:bd5724029f435f3cb71156ad41843383ab03e1b1eed915aa473ac05459b07ad9","observation_id":"a5214038-2b40-477f-81fc-f6aea0689b8e","resolution":{"observed_at":"2026-07-10T16:47:24.840355Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.836691Z","title":"Offline reinforcement learning with implicit q-learning","venue":null,"work_id":"456a16d8-57ac-4eae-9864-171712184041","year":2022},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:a525620f5e46d306363a4f19b45c12a7c80816cf8c306dc48ab8275f216544b8","observation_id":"7c85920c-f05f-4c4f-8f51-ef43474fb1b4","resolution":{"observed_at":"2026-07-10T16:47:24.838043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.779553Z","title":"State-covering trajectory stitching for diffusion planners","venue":null,"work_id":"f110b602-9c28-466d-aa04-058921df7cf6","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:cd78225325a265e31504c8a2a4dc6a1842f0fa7d92f4335190fbbb639638b0b7","observation_id":"e7554da2-c2c7-448f-b792-d7c9f3641539","resolution":{"observed_at":"2026-07-10T16:47:24.780750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06108","last_updated":"2025-08-08T08:12:14Z","snapshot_observed_at":"2026-08-11T13:25:22.589281Z","submitted_at":"2025-08-08T08:12:14Z","title":"GCHR : Goal-Conditioned Hindsight Regularization for Sample-Efficient Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2508.06108","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.06108","snapshot_observed_at":"2026-07-10T16:47:24.432985Z","title":"GCHR : Goal-Conditioned Hindsight Regularization for Sample-Efficient Reinforcement Learning","venue":"cs.LG","work_id":"ed05b362-c92e-4570-a382-65d1debbb661","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2508.06108","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:c4687252d7c32d07bcbf846be7eb41640766f4e881cae2d415ca744c8821475c","observation_id":"af6f7d4d-8aad-4988-bc45-eb5b6f2f2c38","resolution":{"observed_at":"2026-07-10T16:47:24.434557Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":"2005.01643","doi":"10.1613/jair.1.17526","metadata_source":"pith","pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","venue":"cs.LG","work_id":"597b6f46-d60f-451f-8f34-7d32876a9014","year":2020},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:1087910bfc36fd93ceaa6edd5fe67548281c42a3b017092a78212784b1c37300","observation_id":"8af1fe5e-7ce1-4568-9475-3ff63c78dd8a","resolution":{"observed_at":"2026-07-10T16:47:24.456442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.844673Z","title":"Metric residual network for sample efficient goal- conditioned reinforcement learning","venue":null,"work_id":"12c9d12b-2aee-45d5-8450-4ec78e5d0b08","year":2023},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:15d359bf61c050643eb64374c48572b27587e3475346f35ac43394bed1681545","observation_id":"392a92a7-0807-4b3f-927a-077d51a41167","resolution":{"observed_at":"2026-07-10T16:47:24.845961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.05153","last_updated":"2025-05-05T16:26:30Z","snapshot_observed_at":"2026-08-16T12:52:16.886167Z","submitted_at":"2025-03-07T05:22:52Z","title":"Generative Trajectory Stitching through Diffusion Composition","version":2},"cited_work":{"arxiv_id":"2503.05153","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.05153","snapshot_observed_at":"2026-07-10T16:47:24.430379Z","title":"Mishra, Yilun Du, and Danfei Xu","venue":"cs.RO","work_id":"8f953dc6-8d61-4b5d-ad36-f7efc2dedc85","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2503.05153","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:8b2bef81a337264c83fafbc40b080c915dd75bb9f81c772c3c47e60703ce1940","observation_id":"a5c757b8-2e77-4d2c-a0bf-64270616b7da","resolution":{"observed_at":"2026-07-10T16:47:24.431975Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.03023","last_updated":"2022-11-10T05:13:14Z","snapshot_observed_at":"2026-08-16T16:54:51.993656Z","submitted_at":"2022-06-07T05:40:16Z","title":"How Far I'll Go: Offline Goal-Conditioned Reinforcement Learning via $f$-Advantage Regression","version":2},"cited_work":{"arxiv_id":"2206.03023","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.03023","snapshot_observed_at":"2026-07-10T16:47:24.468965Z","title":"How far i’ll go: Offline goal-conditioned reinforcement learning viaf-advantage regression","venue":"cs.LG","work_id":"53566978-b6e8-416c-b951-c8ea3a6238b4","year":2022},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2206.03023","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:d0efdf1f72b9e1c305e51df392ed34a19dcdc70248dd16abcb5f5dadace6db66","observation_id":"9ce5ffd3-bfce-47df-b279-2e80dce16d4a","resolution":{"observed_at":"2026-07-10T16:47:24.470362Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.846582Z","title":"Horizon generalization in reinforcement learning","venue":null,"work_id":"87f2a4b0-3147-4aee-9ed6-30f9da1b7666","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:4defb014506e5a94894aaa982ed2b99188a7219a0cc72df073d31056b72b5809","observation_id":"0dc06858-e9ae-4a47-b03c-9c0fff2cb4a8","resolution":{"observed_at":"2026-07-10T16:47:24.847763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.850834Z","title":"Offline goal-conditioned reinforcement learning with quasimetric representations","venue":null,"work_id":"762b1472-39df-4ae8-a8cc-7d5b9f89a45e","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:3c022d4af43a0e71d10d2333553c48d7c1c4f6ed5d6574620aa87b276826cb8f","observation_id":"44393bcf-7b5b-4dec-8498-ecea8f77737d","resolution":{"observed_at":"2026-07-10T16:47:24.852325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.838646Z","title":"Offline goal-conditioned reinforcement learning with quasimetric representations","venue":null,"work_id":"2f01a287-4870-45e0-9395-dfb887ae6509","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:d1a7375f73078423fff4785c2d11a01d1aca3a71ae696b36dbd96172910751f7","observation_id":"40569da3-c1de-4928-b1c6-ae2b1a701111","resolution":{"observed_at":"2026-07-10T16:47:24.839921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17098","last_updated":"2025-03-10T07:33:32Z","snapshot_observed_at":"2026-08-16T13:39:58.866610Z","submitted_at":"2024-06-24T19:36:45Z","title":"Learning Temporal Distances: Contrastive Successor Features Can Provide a Metric Structure for Decision-Making","version":2},"cited_work":{"arxiv_id":"2406.17098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17098","snapshot_observed_at":"2026-07-10T16:47:24.462133Z","title":"Learning temporal distances: Contrastive successor features can provide a metric structure for decision-making","venue":"cs.LG","work_id":"2bce837d-c5da-4693-ad6e-1aa8c8c3c5ce","year":2024},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2406.17098","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:94a491e4a754cedc8b9cb43d388670a579095456d6879b15f2026c305b566b27","observation_id":"f28d030e-dcb3-42f3-9520-c547166a530d","resolution":{"observed_at":"2026-07-10T16:47:24.463502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.07257","last_updated":"2026-05-22T22:31:02Z","snapshot_observed_at":"2026-08-16T15:16:41.697404Z","submitted_at":"2025-10-08T17:20:53Z","title":"Test-Time Graph Search for Goal-Conditioned Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2510.07257","doi":null,"metadata_source":"pith","pith_arxiv_id":"2510.07257","snapshot_observed_at":"2026-07-10T16:47:24.464658Z","title":"Test-time graph search for goal-conditioned reinforcement learning","venue":"cs.LG","work_id":"c1559129-2666-44eb-9eb6-c4e178431680","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2510.07257","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:8c7b95a21326eceea02d18cb74b6939c9363d872a6951eae3261bcf73da38729","observation_id":"2b058db8-25b2-4753-a69f-f0f2b3afcc3c","resolution":{"observed_at":"2026-07-10T16:47:24.465922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.856694Z","title":"Normalizing flows for probabilistic modeling and inference.Journal of Machine Learning Research, 22(57):1–64","venue":null,"work_id":"5934b632-8304-4762-b14a-6d535ddc01cc","year":2021},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:618388db36e34fb945847afe8c862a572a7b658fb7cec37db38e74b827a0685c","observation_id":"22e47378-f8c3-4f0f-b601-cc2f1a39f569","resolution":{"observed_at":"2026-07-10T16:47:24.858017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.860551Z","title":"Ogbench: Benchmarking offline goal-conditioned rl","venue":null,"work_id":"11e66274-6d55-4993-b8f0-d081fb7e9e25","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:7f63b0fd55f7dcc3ae446007d73cf603a9c4a6490ed09f64acb2f7fe6d41bccc","observation_id":"65c985d7-65c7-4e3c-9504-09670d9ae058","resolution":{"observed_at":"2026-07-10T16:47:24.861789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.840576Z","title":"HIQL: Offline goal-conditioned RL with latent states as actions","venue":null,"work_id":"839d3003-6e81-4b03-80ed-9e078f3ea652","year":2023},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:280bdfa4ee11646a3ed5877195f7b358b3a3e1def76da9f5a6164ca9c50ac809","observation_id":"d03087d1-d02b-48f3-91f3-a78da3beef59","resolution":{"observed_at":"2026-07-10T16:47:24.841856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15567","last_updated":"2024-05-26T17:44:52Z","snapshot_observed_at":"2026-08-16T14:15:48.312148Z","submitted_at":"2024-02-23T19:09:10Z","title":"Foundation Policies with Hilbert Representations","version":2},"cited_work":{"arxiv_id":"2402.15567","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15567","snapshot_observed_at":"2026-07-10T16:47:24.471563Z","title":"Foundation policies with hilbert representa- tions","venue":"cs.LG","work_id":"2fb27f1f-1c8d-4966-9179-8be232c321ee","year":2024},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2402.15567","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:37ede01274860f98b6e4c2443aa626b9ac142eeb3e4cf8036bdc1ae866d85ac0","observation_id":"c5a727c8-13b9-454a-9d4b-68673740704c","resolution":{"observed_at":"2026-07-10T16:47:24.472888Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02538","last_updated":"2025-05-25T22:15:41Z","snapshot_observed_at":"2026-08-12T18:03:00.749482Z","submitted_at":"2025-02-04T18:04:05Z","title":"Flow Q-Learning","version":2},"cited_work":{"arxiv_id":"2502.02538","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.02538","snapshot_observed_at":"2026-07-10T16:47:24.448335Z","title":"Flow Q-learning","venue":"cs.LG","work_id":"aaf75949-519b-45a5-8a13-f387de951d31","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2502.02538","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:7149d1516e8de47e4651e0550658a11cd3a4f7ada08cc0c0a78542187868b982","observation_id":"c63ff626-42f6-4438-943e-66e6f8706a76","resolution":{"observed_at":"2026-07-10T16:47:24.449484Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"1910.00177","doi":"10.48550/arxiv.1910.00177","metadata_source":"pith","pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","venue":"cs.LG","work_id":"ab561983-ab59-4f04-a11e-a467ddde4848","year":2019},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:b9a52dd1317ee14e93cb64f4a1e730792233086b8fc942c440fec5bd3d862e72","observation_id":"f679789f-7874-4f84-b3c5-7ce43fff3acd","resolution":{"observed_at":"2026-07-10T16:47:24.467632Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.854446Z","title":"Bridging offline reinforcement learning and imitation learning: A tale of pessimism","venue":null,"work_id":"740c2ff6-4c69-4a3d-a89b-ee2b88970e09","year":2021},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:11277e4fe96e57fdf055f704b0378cbd87fc4d70bc39af95cbf6172d13f396aa","observation_id":"e1b51905-8eec-40b9-a270-4101c89ebcc1","resolution":{"observed_at":"2026-07-10T16:47:24.855688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.02532","last_updated":"2023-06-01T15:18:21Z","snapshot_observed_at":"2026-08-16T15:42:31.062273Z","submitted_at":"2023-04-05T15:52:34Z","title":"Goal-Conditioned Imitation Learning using Score-based Diffusion Policies","version":2},"cited_work":{"arxiv_id":"2304.02532","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.02532","snapshot_observed_at":"2026-07-10T16:47:24.457758Z","title":"Goal-conditioned imitation learning using score-based diffusion policies","venue":"cs.LG","work_id":"86c1c03b-102c-427e-9305-055f1a55fe15","year":2023},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2304.02532","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:f5ad6d552b3a78d3af71cb7e3704c4a7568dbf23ba8a7b7e2545e53c17cf751a","observation_id":"f73311ca-3712-4836-9759-fb1fe89ffc1e","resolution":{"observed_at":"2026-07-10T16:47:24.459306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.825584Z","title":"Score models for offline goal-conditioned reinforcement learning","venue":null,"work_id":"aae14107-7a7b-4a94-a57a-75b63a371173","year":2024},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:0fc2c6129d45cd33bc9e4bfb08185f99c5f0e3e58569f7860ab3618f3b1a4f99","observation_id":"6431ec90-ccd5-48ed-af97-cc237cf713f6","resolution":{"observed_at":"2026-07-10T16:47:24.827069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.10024","last_updated":"2020-11-19T18:47:40Z","snapshot_observed_at":"2026-08-16T19:04:38.358475Z","submitted_at":"2020-11-19T18:47:40Z","title":"Parrot: Data-Driven Behavioral Priors for Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2011.10024","doi":null,"metadata_source":"pith","pith_arxiv_id":"2011.10024","snapshot_observed_at":"2026-07-10T16:47:24.453726Z","title":"arXiv preprint arXiv:2011.10024 , year=","venue":"cs.LG","work_id":"0432c5f9-f5c2-4b3d-a73d-ba49bc67b43d","year":2020},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/2011.10024","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:4019834f8211227581de1b7921ba1d00f405f8acf9e9b778009d621e3834e0b8","observation_id":"e65c9b04-a47b-493b-aa93-bef4ebc0e224","resolution":{"observed_at":"2026-07-10T16:47:24.454982Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.826542Z","title":"GOPlan: Goal- conditioned offline reinforcement learning by planning with learned models","venue":null,"work_id":"412d4e20-97e0-48d9-9e0b-979cc34cd339","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:3487b8ef222a8b2116cc5f3a78fac5e0ea552805881351e2dcba44ff82142914","observation_id":"8cc1b3c7-3f1f-4a4a-816c-d699a0d8b37f","resolution":{"observed_at":"2026-07-10T16:47:24.827971Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.813958Z","title":"Optimal goal-reaching reinforcement learning via quasimetric learning","venue":null,"work_id":"4c774b19-bcf4-4869-9922-0b2d9cdfbb07","year":2023},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:c0eb80ca5565b990cc9da3c24132b782f4f11d0439fab95c894dede490012b13","observation_id":"7c16e409-2c3d-44a4-8b2a-c71258c8dad2","resolution":{"observed_at":"2026-07-10T16:47:24.815618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.02771","last_updated":"2019-06-06T18:43:19Z","snapshot_observed_at":"2026-08-14T16:19:37.675825Z","submitted_at":"2019-06-06T18:43:19Z","title":"Improving Exploration in Soft-Actor-Critic with Normalizing Flows Policies","version":1},"cited_work":{"arxiv_id":"1906.02771","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.02771","snapshot_observed_at":"2026-07-10T16:47:24.469528Z","title":"Improving Exploration in Soft-Actor-Critic with Normalizing Flows Policies","venue":"cs.LG","work_id":"b98b3a52-1ed7-4c86-bbe6-20b42c2ec1ad","year":2019},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"cited_paper":"/paper/1906.02771","citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:7e3d20ee4d780cc0fd9b96e769397982b9bf352ef7e357138fbd6219b3044d23","observation_id":"e3419ac9-02e0-41dc-ba5f-9a937b33a7d7","resolution":{"observed_at":"2026-07-10T16:47:24.470801Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.808676Z","title":"A policy-guided imitation approach for offline reinforcement learning.Advances in neural information processing systems, 35:4085–4098, 2022","venue":null,"work_id":"216d8e06-ed67-4834-8555-f8477c34229a","year":2022},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:240d75498672ec8a7d75be7fc5a128406b71711776fda3051c51993925222f47","observation_id":"09665de8-f94d-46a0-a3f4-80d692a5fa30","resolution":{"observed_at":"2026-07-10T16:47:24.810526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.823140Z","title":"An optimal discriminator weighted imitation perspective for reinforcement learning","venue":null,"work_id":"cce76e90-c45a-418d-a233-7a4c13ea19ec","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:8d3c5de3d7de2f5fbebc489023aed947709426dcf19d0a75ab44853ef5e13847","observation_id":"d3ad5a0c-21ba-4904-8f98-7ccc30e175dc","resolution":{"observed_at":"2026-07-10T16:47:24.824630Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.802518Z","title":"Breadth-first exploration on adaptive grid for reinforcement learning","venue":null,"work_id":"0142d4c2-b3cc-4fe8-951b-9fbcfcac1b40","year":2024},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:99fa12c9360c358be98f96d182538d281740d04cb607d999559d1fbcecbc2f62","observation_id":"f853da24-14b5-4be2-aeda-6893d6b98a26","resolution":{"observed_at":"2026-07-10T16:47:24.804150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.827621Z","title":"Scaling goal-conditioned reinforcement learning with multistep quasimetric distances","venue":null,"work_id":"96da9dab-f2fd-49d1-8ced-e2a03333b339","year":2026},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:17613b505b85324a9b53e0414281425c46ddafbca65b70bfc87b19163a37236b","observation_id":"b8062c9b-78ec-48cd-9a59-525f9786f700","resolution":{"observed_at":"2026-07-10T16:47:24.829050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.467015Z","title":"Flattening hierarchies with policy bootstrapping","venue":null,"work_id":"d06abc5c-9007-4e05-9f7b-bb36b8b9782f","year":2025},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:f1f1c3ee731bd07d2c729063eab6213207ed8ce1ac86ed36f57a44e3afb0c4ab","observation_id":"6952dee9-8e9a-49c8-91f4-b55444fe9579","resolution":{"observed_at":"2026-07-10T16:47:24.468473Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.797575Z","title":null,"venue":null,"work_id":"658dd699-c158-4cc8-b401-f8023ae27947","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:046046f663cd00cdeb82bca4062fb9b4106f07a0ad2e0db154c77ff5b01aa51b","observation_id":"250229ea-a3d1-4529-aef6-be33ef4dfb3b","resolution":{"observed_at":"2026-07-10T16:47:24.798899Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.833263Z","title":null,"venue":null,"work_id":"03069246-1520-4cea-af25-6cdbf757ee35","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:df3d55edc4669f573d6ac5bda45ebc3723b12e39f9ac6873f06f91d5d40470a7","observation_id":"a552ccad-5955-4c31-924e-3f136da9190b","resolution":{"observed_at":"2026-07-10T16:47:24.834541Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.829589Z","title":null,"venue":null,"work_id":"ff10b011-7544-48d3-b977-eef0268d1379","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:9df030fab408c3d539e3f70842f21a63d921d0f26fe4f2c2bb6b5cd1a69afd84","observation_id":"a4dadcbf-c690-46a1-a6a0-bdad8c4494a1","resolution":{"observed_at":"2026-07-10T16:47:24.830859Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.799584Z","title":null,"venue":null,"work_id":"e95bceb4-8d1a-4c24-bec9-ca28045653a3","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:568466e21fc8b9e36df3897f6111948a667ffe4ef36036a274727fecec5b350b","observation_id":"49f18931-36a5-4330-b001-51413b1829ba","resolution":{"observed_at":"2026-07-10T16:47:24.800887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.806201Z","title":"∆∗ = 0 iff w is on an optimal path","venue":null,"work_id":"5f2e16f2-ce0d-4a50-aca4-d7dfda9bbc10","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:20751cc270d88d2115c67dfc265ee0f6fbcacb5c9e1a56081e5e4bd45b4dd644","observation_id":"f62d64d1-a2f9-4ca2-b1b3-ddf9754cee4b","resolution":{"observed_at":"2026-07-10T16:47:24.807957Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.856200Z","title":"ELBO/ODE estimates.AWR requires evaluating logπ H(z|s, g) for the weighted MLE objective","venue":null,"work_id":"92373e62-305c-4987-8275-e41d14ae3098","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:82095843e88d4122429e4d61414c44a0bccf1706b68e79256b15e9c655171193","observation_id":"882866f3-3199-4e05-a5b2-a4c7a51efd0d","resolution":{"observed_at":"2026-07-10T16:47:24.857563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.862388Z","title":null,"venue":null,"work_id":"82ffa214-9b90-41f6-9ff1-c0640b681e7f","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:aef967b8eed8572907e348d4fe33762869114f9ae41407bce9cedc2775c267d3","observation_id":"3c5906cd-6e4a-4294-b927-78de85192af1","resolution":{"observed_at":"2026-07-10T16:47:24.863650Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.816279Z","title":"valid corridor","venue":null,"work_id":"0bb9c0e1-f516-448a-92fe-f2633b864277","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:0933fa183b54e267393ce263476c26243502f401449eb7af044d55533f121165","observation_id":"8132e8c2-e28c-4777-85a1-69e8c97f5748","resolution":{"observed_at":"2026-07-10T16:47:24.817793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T16:47:24.793055Z","title":"lucky exploration","venue":null,"work_id":"4482cefc-1081-48cf-8ff1-0727869e5b55","year":null},"citing_paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-10T16:39:10.354308Z"},"links":{"citing_paper":"/paper/2607.07855"},"observation_digest":"sha256:de46f4b1e8766e40b6539bfb5dfbff7b8b13db9ecdc3588d892d5b2a9d2035d2","observation_id":"27527219-e277-442d-8551-91a8c3ef2063","resolution":{"observed_at":"2026-07-10T16:47:24.794535Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.07855","last_updated":"2026-07-08T18:33:48Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T20:30:29.084746Z","submitted_at":"2026-07-08T18:33:48Z","title":"NFTR: From Provable Mode-Averaging to Geodesic Subgoal Selection in Offline Goal-Conditioned RL"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":2,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":5,"verified_exact":16,"verified_fuzzy":33},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 1 inbound Pith citation observation for arXiv:2607.07855."}