{"as_of":"2026-08-16T10:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c4d2edd60ceab83508cd78685d24718e8ea572f6f0ebffb5d45d731861c01b73","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T16:27:33.377046Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.05545/citation-record","integrity":"/paper/2509.05545/integrity","json":"/paper/2509.05545/citation-record.json","paper":"/paper/2509.05545"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.913438Z","title":"Hindsight experience replay","venue":null,"work_id":"25c000b0-7b0e-4d58-8b97-9533cddce444","year":2017},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.232940Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:bd6a7289dd687b6a0783c64da16611ae758505320e4b3c62803a51e56688f3d1","observation_id":"05bd76c5-0d52-49fd-a501-51c0239a0ed9","resolution":{"observed_at":"2026-08-15T16:27:33.920035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.895941Z","title":null,"venue":null,"work_id":"0a23e0c7-eb6f-4c1d-b599-99306aedd5ba","year":2013},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.238619Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:a6d70f67cbfa586a7f32cd83d28de82e8ddde44c1cc2abc17ec67c2cdbd31338","observation_id":"e8ad6641-f987-4468-96d9-d0b70a184f94","resolution":{"observed_at":"2026-08-15T16:27:33.900806Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.876169Z","title":"Barto and Sridhar Mahadevan","venue":null,"work_id":"59dca174-121d-4e18-82d9-427bd3adae85","year":2003},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.243883Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:21f298272eff78626940734556ba41d90ff39bebf96c4b2d5a1147c61d83ce87","observation_id":"56f1df9e-3bb9-45c8-bc3d-6505cf4d91ed","resolution":{"observed_at":"2026-08-15T16:27:33.882425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.249281Z","title":"Bertsekas and John N","venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.249281Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:28e75b65208ff05ba99cc929627cdae8b4d76ff7de0d3418255ab848372ee337","observation_id":"6fc8c6bd-0a98-4c7b-aa32-a0a4be840ef4","resolution":{"observed_at":"2026-08-15T16:27:33.249281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.255041Z","title":"Bertsekas and John N","venue":null,"work_id":null,"year":1996},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.255041Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:b14129b04d64dd60c8010f7228e811680af5ea6b78920c1b4820d834889d4647","observation_id":"96003cee-06a7-4f06-b1a3-47336397cc95","resolution":{"observed_at":"2026-08-15T16:27:33.255041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.829707Z","title":"Near-optimal regret bounds for stochastic shortest path","venue":null,"work_id":"037936bf-70f2-4dcf-bc8a-bb3401f0393b","year":2020},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.260527Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:84639013bb8fa4f8096bec77c8b46f0e11599bbb043af4614bee96f034da3cd0","observation_id":"a6181469-524e-429d-9779-8f176f16ae0f","resolution":{"observed_at":"2026-08-15T16:27:33.836185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.808746Z","title":"Improving generalization for temporal difference learning: The successor representation.Neural Computation, 5(4):613–624, 1993","venue":null,"work_id":"260ed306-1fcd-4ae9-a6f7-4ab70e204bca","year":1993},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.266474Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:0a740e1094cf3925b36ff4f968f0880ddee879ea181f855db763c177196a4275","observation_id":"5aed9829-5eba-4702-88a9-9e5474ffe8c5","resolution":{"observed_at":"2026-08-15T16:27:33.815472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.791007Z","title":"Dietterich","venue":null,"work_id":"c4492caf-06c1-4b46-800c-418ed5df05d5","year":2000},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.272000Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:fa0dbfa608d2c9fab2b5cfba7848454e95e06fae3bb3e05f228f084652d0affc","observation_id":"6aa8b705-3a1e-4ab9-b947-46ae8de869db","resolution":{"observed_at":"2026-08-15T16:27:33.796513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.773446Z","title":"Diversity is all you need: Learning skills without a reward function","venue":null,"work_id":"1b658d4a-9b77-4e95-9d7d-24e4781357d0","year":2019},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.277163Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:7cf232a741bae2c64ddee3440a7c80b2b1db5a564fe1dccaf948f09377f11907","observation_id":"4a8f384b-3ef5-4401-a2b0-90770e7f07aa","resolution":{"observed_at":"2026-08-15T16:27:33.778644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.755794Z","title":"Contrastive learning as goal- conditioned reinforcement learning","venue":null,"work_id":"1669cc5b-c276-40dd-9269-fe7d34f985b4","year":2022},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.282625Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:e2562ed4c7449faf3c9d7bcb46cecfbf52772b23db1758c874f6d92220eac43c","observation_id":"29ad330f-ba64-4167-bcc6-4e73e3819cbb","resolution":{"observed_at":"2026-08-15T16:27:33.761464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.737890Z","title":"Gershman","venue":null,"work_id":"df9e25f0-b13d-4eb9-a352-970738455063","year":2018},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.287910Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:9f17a06a78c8775d8708af96da7ee7225f5f2ba3a9229a93b559988a2ef4a9d4","observation_id":"fc62e767-aa32-4749-87ae-6bf39a49999b","resolution":{"observed_at":"2026-08-15T16:27:33.743477Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.06088","last_updated":"2020-10-02T19:49:10Z","snapshot_observed_at":"2026-08-13T23:59:03.584749Z","submitted_at":"2019-12-12T17:26:47Z","title":"Learning to Reach Goals via Iterated Supervised Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.06088","snapshot_observed_at":"2026-08-15T16:27:33.292977Z","title":"Learning to reach goals via iterated supervised learning","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.292977Z"},"links":{"cited_paper":"/paper/1912.06088","citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:d35fa50343d73efa071ad8a6e00b8720d020a7c3642c527b3c625b4c801ea227","observation_id":"9577541d-712f-4db9-ae4d-f9326ebcec4f","resolution":{"observed_at":"2026-08-15T16:27:33.292977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.718148Z","title":"Dynamical distance learning for semi-parametric control","venue":null,"work_id":"f45336b0-2cc9-4f52-aa47-ede86d627577","year":2020},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.298878Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:ab3763b918ad669462d3468562170367f33abdac3b0137a4fc9f6d5962072249","observation_id":"872f54b0-5188-4491-a590-eaaf70df424e","resolution":{"observed_at":"2026-08-15T16:27:33.724725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.700019Z","title":"Finite-sample convergence rates for Q-learning","venue":null,"work_id":"a231f63e-6af8-468a-9604-7c78745b0778","year":1999},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.304257Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:c2de36e75396a0a0cbfbc4c1a1a241648b468da45f66340506c61e3ac5820ceb","observation_id":"587b32ff-c44f-424e-a71a-9ab1179dc598","resolution":{"observed_at":"2026-08-15T16:27:33.706269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.680434Z","title":"Learning multi-level hierarchies with hindsight","venue":null,"work_id":"c4faadca-0744-4e8a-bc07-175641cf71d2","year":2019},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.309289Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:5ff7f363bb7e1a358ca1d96a4f82c3818b20c28d441e92972d438b6eca305563","observation_id":"dd3af30b-7977-4a94-bc32-fbb71eeace47","resolution":{"observed_at":"2026-08-15T16:27:33.686190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.663737Z","title":"Lillicrap, Jonathan J","venue":null,"work_id":"2780ee58-c1d1-4601-8e4a-7429fb5753d0","year":2016},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.314318Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:e5340af647655a80197d942cc6377a819c9a1a7013550f7c7f5c09a5b020d15b","observation_id":"03c69c57-e2ca-4da5-bd5d-8cd2f845dd46","resolution":{"observed_at":"2026-08-15T16:27:33.668970Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.644232Z","title":"Learning stochastic shortest path with linear function approximation","venue":null,"work_id":"5fe08b2e-a810-4f78-a0d7-f01d51b13949","year":2022},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.319086Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:e532d33d14901294d6d63ca20117885660478f40c970fd62dadcf54d0ba739c5","observation_id":"932a3765-cc86-4ec1-80b2-af34429bbea7","resolution":{"observed_at":"2026-08-15T16:27:33.650598Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.624641Z","title":"Data-efficient hierarchical reinforcement learning","venue":null,"work_id":"0a6ac6a6-1710-4d9e-8718-a6467202ae5f","year":2018},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.324260Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:bb5f7e6d50876fdc210c7fe6f709c92b069c656dd47b2c148d814097e89b3155","observation_id":"84603847-4463-482e-92cf-c1a60ee9a232","resolution":{"observed_at":"2026-08-15T16:27:33.629928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.602531Z","title":"Hierarchical reinforcement learning: A comprehensive survey.ACM Computing Surveys, 54(5):1–35, 2021","venue":null,"work_id":"08c38b46-de7e-4b70-afd3-4572d5e130e1","year":2021},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.330109Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:0ea46d527ca3969784c2e94fa14b0b3fd3f8ce4d883b98485d4d56c7dc80cf2d","observation_id":"dab6480a-b62f-455c-835f-06d3add4426f","resolution":{"observed_at":"2026-08-15T16:27:33.609131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.583178Z","title":"Efros, and Trevor Darrell","venue":null,"work_id":"9c241f55-f318-4bba-ac8c-ceb6c3a89215","year":2017},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.335666Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:6709cff1408a1de7909c8d16a7d96f3384fc9787db8d8fbdfa18ab562632a871","observation_id":"935be90d-192e-467b-b257-59597388b7cf","resolution":{"observed_at":"2026-08-15T16:27:33.589629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.564804Z","title":"Universal value function approximators","venue":null,"work_id":"97316052-0f88-4c97-8be3-e3b8fad42d91","year":2015},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.340887Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:b2ecb80768136be3cb91a9ddbd1d1ebd54cc969f71ffc6a1c72f9a36bb4d57f3","observation_id":"382b9d60-c1fb-4091-b7d9-79728ea1233e","resolution":{"observed_at":"2026-08-15T16:27:33.570166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.546697Z","title":"Toshev, Sergey Levine, and Brian Ichter","venue":null,"work_id":"850352ae-9f3f-4d8c-b077-4dc561227b58","year":2022},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.346188Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:c4b12615be4b977c3b638083a6f30fdc8dec5ff69ba37148407ab8da2a0bdbd2","observation_id":"66b03e62-c692-42f4-83f3-c9e313735709","resolution":{"observed_at":"2026-08-15T16:27:33.552596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.351379Z","title":null,"venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.351379Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:1bd867efe10354151e7e842c4e83daec374f2e25ac3685c770c30956a7262518","observation_id":"07b67f88-073e-4a8d-8b9e-607a63254adb","resolution":{"observed_at":"2026-08-15T16:27:33.351379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.510706Z","title":"Sutton, Doina Precup, and Satinder Singh","venue":null,"work_id":"69bac1f1-c4d3-46ab-984c-e52bf8c89bf5","year":1999},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.356283Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:2616b8ace5db719f1b2fb04eaf1b62182275a5c2044cc702af89e709e5cfb569","observation_id":"54821549-38df-486b-8da5-b03b789a7aaa","resolution":{"observed_at":"2026-08-15T16:27:33.515944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.493086Z","title":"Morgan & Claypool Publishers, 2010","venue":null,"work_id":"8ecb83f2-9528-4701-9583-1c2f1ca19fe1","year":2010},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.361600Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:c2ff5acdfaad996a97e0b2c98524f605d5f1706a69cf5626f90e36517fc0beca","observation_id":"9dc56b6d-a174-4c62-adc3-dca78457cbea","resolution":{"observed_at":"2026-08-15T16:27:33.498179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.474869Z","title":"Value iteration networks","venue":null,"work_id":"3a6ed930-afeb-4138-9469-4a9cb617d206","year":2016},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.367104Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:4642de087170dc77e997dd427c42ef2f85db726d4c1bf0734cfda40c3d3e0420","observation_id":"42a9d886-b834-4087-9119-7104e373c288","resolution":{"observed_at":"2026-08-15T16:27:33.480646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.455544Z","title":"Sample complexity bounds for stochas- tic shortest path with a generative model","venue":null,"work_id":"bc5ed253-1c44-4812-a1ad-bcb1865acc2d","year":2021},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.372191Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:aea97dda6ae49aa027a69e3bb87a5f2580f4666a0d21e52a6d527cae2006c4b1","observation_id":"c21094b6-4904-447e-928e-071c048c4745","resolution":{"observed_at":"2026-08-15T16:27:33.462195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T16:27:33.433264Z","title":null,"venue":null,"work_id":"38a3bf05-79c5-4693-b350-3ca70a8a6ba9","year":1992},"citing_paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T16:27:33.377046Z"},"links":{"citing_paper":"/paper/2509.05545"},"observation_digest":"sha256:9f829f42b4b9b54bb2ff7c0b1cde5a8b6a00b230e1b380e3d18f128dfbbfbc72","observation_id":"03cd3234-0a4b-4fbc-9567-7c5636a29d88","resolution":{"observed_at":"2026-08-15T16:27:33.439595Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.05545","last_updated":"2025-09-06T00:10:15Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T16:21:27.048842Z","submitted_at":"2025-09-06T00:10:15Z","title":"Reinforcement Learning with Anticipation: A Hierarchical Approach for Long-Horizon Tasks"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":6,"verified_exact":0,"verified_fuzzy":22},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2509.05545."}