{"as_of":"2026-08-18T06:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:944e09bbb165bbb2aec2f9b023a9005855e20cd42c15d617c0fd4ea2d8a394dd","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T18:32:40.237195Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.19785/citation-record","integrity":"/paper/2506.19785/integrity","json":"/paper/2506.19785/citation-record.json","paper":"/paper/2506.19785"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:39.973918Z","title":"Hindsight experience replay","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:39.973918Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:2d1bed4d2b7d396b089c6a96426166028eb57e21cbfe0284779e5cef15a723b4","observation_id":"4eed84d9-6f8d-427d-a7a2-ed0ca11219be","resolution":{"observed_at":"2026-08-15T18:32:39.973918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12894","last_updated":"2018-10-30T17:44:42Z","snapshot_observed_at":"2026-08-14T18:06:54.993797Z","submitted_at":"2018-10-30T17:44:42Z","title":"Exploration by Random Network Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.12894","snapshot_observed_at":"2026-08-15T18:32:39.978756Z","title":"Exploration by random network distillation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:39.978756Z"},"links":{"cited_paper":"/paper/1810.12894","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:86012911365f87ed2393a7d6c045d14a52f7f3f885fdc577ae2b2be66f0e9dda","observation_id":"aefa820b-5732-4b7d-b9bb-eca0b55669e7","resolution":{"observed_at":"2026-08-15T18:32:39.978756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:41.001538Z","title":"Acting optimally in partially observable stochastic domains","venue":null,"work_id":"c0688b2f-51ef-4d11-8df6-6eb12636f1ce","year":1994},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:39.983449Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:c1d8c5c1f9ed33a00e789f213105862283d22c07988816c1fa5471c847f21c44","observation_id":"742acf09-0607-419b-8a4c-2bc9eb190b5f","resolution":{"observed_at":"2026-08-15T18:32:41.006262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.986956Z","title":"Scalable methods for computing state similarity in deterministic markov decision processes","venue":null,"work_id":"3ef372a2-88cb-44cf-aa37-cc652ec2daec","year":2020},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:39.988656Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:02650274f7823afc1194c3116f1f2fe891cd96bb65f5d543ab88882bad13e693","observation_id":"81c6c53c-a58a-447c-96a5-d82512dcad32","resolution":{"observed_at":"2026-08-15T18:32:40.991586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.972666Z","title":"Contrabar: Contrastive bayes-adaptive deep rl","venue":null,"work_id":"0b0b3f07-bb9f-42cf-a7d4-497f5ad6d567","year":2023},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:39.993276Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:6b732e25bec9cb79ecf00f65d2f6362366d9a10fbfe45f91fdf72f4432b907f8","observation_id":"8aaa6ec9-1884-43ba-9635-c9a6a8f1e56d","resolution":{"observed_at":"2026-08-15T18:32:40.977202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.957875Z","title":"Offline meta reinforcement learning--identifiability challenges and effective data collection strategies","venue":null,"work_id":"c2acd9d1-2f7f-4a05-af17-7d0f562cef4c","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:39.997723Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:7c0c1e617825915fbfcaad370f81ab304e277e1d8f922794ba18330f98656ae7","observation_id":"329ebb19-5f2a-4b0d-b241-17b35c3302eb","resolution":{"observed_at":"2026-08-15T18:32:40.962529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.002658Z","title":"Provably efficient rl with rich observations via latent state decoding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.002658Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:ff444058cff82cf0941383a5ed2c66ddab736a7b2e2a9d722249339d3bd32489","observation_id":"ddcb0a07-eead-4dc1-bc80-ca962fcaf0e1","resolution":{"observed_at":"2026-08-15T18:32:40.002658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-14T21:31:19.001119Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-15T18:32:40.006906Z","title":"Rl2: Fast reinforcement learning via slow reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.006906Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:1a666fdce3e05fa71a3ec04539c1bbf291148832279ba8b689f69ac11370946f","observation_id":"c8345933-3fa7-4653-9757-77d881a2265f","resolution":{"observed_at":"2026-08-15T18:32:40.006906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.011430Z","title":"Optimal Learning: Computational procedures for Bayes-adaptive Markov decision processes","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.011430Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:63e39dd37182d6bfff500596972557018ac173d782378af762dd5e945defa765","observation_id":"ff6b0d3e-4ab0-4fef-8a6d-d0970d82df51","resolution":{"observed_at":"2026-08-15T18:32:40.011430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-08-14T16:39:48.171461Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-15T18:32:40.015817Z","title":"Challenges of real-world reinforcement learning","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.015817Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:4ca09c90499d9ccd1cb53b07b84bb0f308033cbaa60aa1dbb1c093bb2e27127c","observation_id":"afe8e059-e76b-41a7-9a50-343d5a930523","resolution":{"observed_at":"2026-08-15T18:32:40.015817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.020554Z","title":"Metrics for finite markov decision processes","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.020554Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:7c7be5d2083b6a4bdced216c73ecb2c293d9a7af980d71bf72064f927e74bb85","observation_id":"c1370127-4535-46e7-a256-5775a7bd0ae5","resolution":{"observed_at":"2026-08-15T18:32:40.020554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.024775Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.024775Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:48f1704806f4674a2e529d1542bf45a3d78c21959e448326fcb6893a15378eda","observation_id":"6d8974c9-5a24-4ad9-9c29-31d4a54fbc5e","resolution":{"observed_at":"2026-08-15T18:32:40.024775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.908602Z","title":"Meta learning shared hierarchies","venue":null,"work_id":"4ecf9e07-0287-402a-ba17-71d94f70858f","year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.029212Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:1e37d437bac7fd84ad6266d86a25106387368a0a0ede6696b1063dd48719daed","observation_id":"bea5db9f-3a8b-4ae6-8391-43448372cbe7","resolution":{"observed_at":"2026-08-15T18:32:40.913385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.894191Z","title":"panda-gym: Open-source goal-conditioned environments for robotic learning","venue":null,"work_id":"b76a13c5-e863-4dd1-a395-6fc90f638379","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.033290Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:73dbd4fd587da391e526a1a50f6fecbcf9a8fe1f38f2e96d27ecbdf80d8ed855","observation_id":"7de163ba-a9f4-4b2c-be99-5091f828d07b","resolution":{"observed_at":"2026-08-15T18:32:40.898824Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.037671Z","title":"Deepmdp: Learning continuous latent space models for representation learning","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.037671Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:b57e5902a7cc2252a0b923d26f4c73f3fdb8bbdf95ffe6a4458bdaf221ef7c50","observation_id":"0679263d-a1d9-40f5-9129-4608bd765a4b","resolution":{"observed_at":"2026-08-15T18:32:40.037671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.042019Z","title":"Bayesian reinforcement learning: A survey","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.042019Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:4f1fde7de7bf03d6a2f8a3bdcb67634a4e24d0080ac38e37512a9f5690032aab","observation_id":"e866762d-f887-4119-ab19-898a4dd893ea","resolution":{"observed_at":"2026-08-15T18:32:40.042019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.046245Z","title":"Equivalence notions and model minimization in markov decision processes","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.046245Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:e8b0e95f0fc8c6dad5bb18883b9dbf1f7757ab96abc7017ae77617843ed939cb","observation_id":"0d15f1a2-4646-4c43-9ca1-9e672fee4908","resolution":{"observed_at":"2026-08-15T18:32:40.046245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.853940Z","title":"Learning action translator for meta reinforcement learning on sparse-reward tasks","venue":null,"work_id":"e3a9bfa1-c7d7-4810-adcf-cc55c1546903","year":2022},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.050548Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:97fd4cbb28877054ba02267a1714ef3e91d1596fee0931a00c1b13c9ec627969","observation_id":"2186fe81-698b-4a06-8d04-3a54ddbc3ead","resolution":{"observed_at":"2026-08-15T18:32:40.858879Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.04640","last_updated":"2020-04-30T16:55:56Z","snapshot_observed_at":"2026-08-14T20:53:01.615026Z","submitted_at":"2018-06-12T16:48:52Z","title":"Unsupervised Meta-Learning for Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.04640","snapshot_observed_at":"2026-08-15T18:32:40.054802Z","title":"Unsupervised meta-learning for reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.054802Z"},"links":{"cited_paper":"/paper/1806.04640","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:2a5bcf77dad6df7d21a9d8439a3f2b015cd721c0569581aebed97908cc226d0e","observation_id":"2f2b79e1-123f-4f43-a4ab-f17d8c566052","resolution":{"observed_at":"2026-08-15T18:32:40.054802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.839084Z","title":"Meta-reinforcement learning of structured exploration strategies","venue":null,"work_id":"b4bc1064-e0be-4127-80b1-abb4804d2cc6","year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.059576Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:4ac1d039a524182291079ff2939decc8e5be104aa8ca0e46ee917e98c4f9e873","observation_id":"3edf2a29-a79c-4261-a577-8add56e0a8a9","resolution":{"observed_at":"2026-08-15T18:32:40.844258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.065038Z","title":"Soft actor-critic: Off-policy maximum entropy deep reinforcement learning with a stochastic actor","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.065038Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:c0e6ab73b3da26eaa55bc3f0a1872b05cfea2e60cf7724c91ad96e21daa8ce2d","observation_id":"91295116-9abb-4fbf-9758-fcc12db80e4e","resolution":{"observed_at":"2026-08-15T18:32:40.065038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-15T17:22:37.525122Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-15T18:32:40.069528Z","title":"Dream to control: Learning behaviors by latent imagination","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.069528Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:3327b8c7284095b4f7f609d8415815cc2853b23797c850a92c87394fb29d856e","observation_id":"5fba75d0-3b0a-4427-a9f4-8bc4d8d1f29e","resolution":{"observed_at":"2026-08-15T18:32:40.069528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.073948Z","title":"Bisimulation makes analogies in goal-conditioned reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.073948Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:3bef15c5797fa9e244b866d812dd7ab21c676be933b6557294c107bd6aad072a","observation_id":"e2deaf22-93e2-4bf7-aabd-721829554ecd","resolution":{"observed_at":"2026-08-15T18:32:40.073948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.805855Z","title":"Learning an embedding space for transferable robot skills","venue":null,"work_id":"bcb86f2d-6141-4398-bd4f-bdbbc8180916","year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.079102Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:56ece891546d212b1a1744481de0f1adb19d1f194f49c9e4980d3d8fbdc11aac","observation_id":"d0e1d071-942a-4433-922b-8d6366ee323c","resolution":{"observed_at":"2026-08-15T18:32:40.810530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06424","last_updated":"2019-10-22T15:54:03Z","snapshot_observed_at":"2026-08-16T08:40:24.198376Z","submitted_at":"2019-05-15T20:21:14Z","title":"Meta reinforcement learning as task inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06424","snapshot_observed_at":"2026-08-15T18:32:40.083263Z","title":"Meta reinforcement learning as task inference","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.083263Z"},"links":{"cited_paper":"/paper/1905.06424","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:80aa34f38d7b764821a5358a2a0289f6d4228c52cb0bbf2265ec8a6ca76abcaf","observation_id":"6657c6e9-5ca7-4b59-b547-cb2facef561a","resolution":{"observed_at":"2026-08-15T18:32:40.083263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.088208Z","title":"Notes on state abstractions, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.088208Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:fe7d59f3cfc21f22e643dd6799abc03d07d2999e04cd8d7777cc4fd8156cdbd4","observation_id":"499765a3-3969-4235-ad89-b6698f2976eb","resolution":{"observed_at":"2026-08-15T18:32:40.088208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.092785Z","title":"Towards robust bisimulation metric learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.092785Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:9fdbb35a6ff2f4fe57d8b38ea78fa6c83a8133d7cb1b85d59a7870663c824934","observation_id":"61496504-9d28-42a6-8558-9f139661b7d7","resolution":{"observed_at":"2026-08-15T18:32:40.092785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-08-14T23:50:45.029465Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-15T18:32:40.097456Z","title":"Auto-encoding variational bayes","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.097456Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:8879bc6e91a9a22be584b558e5ad2b369ce35a3f29180e6ad955cd2eb41959c3","observation_id":"210d6b10-00a6-49a9-aa56-9b5713de1aaf","resolution":{"observed_at":"2026-08-15T18:32:40.097456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.773501Z","title":"Meta reinforcement learning with task embedding and shared policy","venue":null,"work_id":"30e7f96c-0e06-46c6-829d-6c148f157e45","year":2019},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.101964Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:aff5c258ce2ed6d38eb3020337eceac4091129c37838544a3248e4ed35f23f7d","observation_id":"ad10649b-c46f-465d-aa0c-28fa1f62795f","resolution":{"observed_at":"2026-08-15T18:32:40.778146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.106227Z","title":"Parameterizing non-parametric meta-reinforcement learning tasks via subtask decomposition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.106227Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:124c96ff6c6cc044f701b20e4203a5e31f98908ac43331fed603babf01914138","observation_id":"46ea98fe-26f6-414e-a327-d416a06c6729","resolution":{"observed_at":"2026-08-15T18:32:40.106227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.749780Z","title":"Decoupling exploration and exploitation for meta-reinforcement learning without sacrifices","venue":null,"work_id":"3d192435-5cf1-4687-aefb-681712670689","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.110242Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:cff89fa523888507886a4cd0349d7e38a2e57f3d86e17ebba95be6f91ec715a7","observation_id":"34861607-ea43-4a6d-ad9e-440c2b06689f","resolution":{"observed_at":"2026-08-15T18:32:40.754415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.114432Z","title":"Behavior from the void: Unsupervised active pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.114432Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:3b8c5efd1f0f6bb835e3a8c399de37759135f3134900f70424250a15a1f9340c","observation_id":"ced538ea-c9ad-457f-bbdd-5bbb97892d0b","resolution":{"observed_at":"2026-08-15T18:32:40.114432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.726012Z","title":"Policy invariance under reward transformations: Theory and application to reward shaping","venue":null,"work_id":"eb31a32f-2f64-43ee-8cee-e042408d6f42","year":1999},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.118809Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:286f8df0f0bf07d38c2c2e59ddcb282af765cd676cef8497dcbcddd22bd1bf99","observation_id":"9f652f41-ce37-4845-b306-449eba8004a9","resolution":{"observed_at":"2026-08-15T18:32:40.731125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.123043Z","title":"(more) efficient reinforcement learning via posterior sampling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.123043Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:6dd92ad84f59cd6271ce14ce16d02841e0c3661b0a4711681acd78383eb10a5e","observation_id":"2f908581-00a1-4534-8307-6db6c28f2dea","resolution":{"observed_at":"2026-08-15T18:32:40.123043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.127310Z","title":"Curiosity-driven exploration by self-supervised prediction","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.127310Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:a8ad589348a3fc1108b4348abe2318046e5d226497ce198b54ef627db34bab5c","observation_id":"0b5329c0-f576-4a18-8694-bd9f990efd31","resolution":{"observed_at":"2026-08-15T18:32:40.127310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.693232Z","title":"Ride: Rewarding impact-driven exploration for procedurally-generated environments","venue":null,"work_id":"27493fb3-a47f-475a-82f8-b084976426b7","year":2020},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.131590Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:a5bd57203596e90925ea53088883ac1690d14c92c81bb59a2e035893bf686fd7","observation_id":"757f3673-8b92-43ce-8ea0-7526f99fb0d1","resolution":{"observed_at":"2026-08-15T18:32:40.697774Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.135728Z","title":"Efficient off-policy meta-reinforcement learning via probabilistic context variables","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.135728Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:7992d24cce22f8e950cb13384fcd9519c5c90e3fde7f860bcc60e90cbd9a1508","observation_id":"7a9779cb-9970-44cb-ae63-e917053e7028","resolution":{"observed_at":"2026-08-15T18:32:40.135728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.670178Z","title":"Residual skill policies: Learning an adaptable skill-based action space for reinforcement learning for robotics","venue":null,"work_id":"dad92cd6-bef5-4dd9-990b-312efde7a53c","year":2023},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.139865Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:c2a43841324d1e612474f4405eb4efd777bb9792205f70be7489e266f09efa12","observation_id":"90722f7a-2c42-4b64-ab1d-0d3ebc999c13","resolution":{"observed_at":"2026-08-15T18:32:40.674907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.655613Z","title":"Planning to explore via self-supervised world models","venue":null,"work_id":"d4320a1d-3b8a-4f2a-b604-df8916b23e47","year":2020},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.144096Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:3eef473f32b7c35158cd26870698b2b3622c60389d9a42443ea91fab581edf7c","observation_id":"396d8839-4e57-4a96-a1aa-9d32e9526552","resolution":{"observed_at":"2026-08-15T18:32:40.660221Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.640763Z","title":"Multi-task reinforcement learning with context-based representations","venue":null,"work_id":"586bbbee-c0b9-486c-b2a2-f8617bd547c4","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.148429Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:457b562ceccda0a8c5e85ecfc66172efc8f75b42d16073e5fed852ded6aea927","observation_id":"4a99ae6b-9c09-40d6-b633-9dfb734e8ac5","resolution":{"observed_at":"2026-08-15T18:32:40.645579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.152660Z","title":"Reinforcement learning: An introduction","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.152660Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:69e19d83e2d5648a53f70cc7d169109383e823889036642b74b65c22a2f90302","observation_id":"b91123ca-55be-41b1-b526-e96a2d4540d8","resolution":{"observed_at":"2026-08-15T18:32:40.152660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.156702Z","title":"Distral: Robust multitask reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.156702Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:350d4040ff2deaafbcf12e59c7d87260135d75ac6f3a9a4252afe17a266e2f6e","observation_id":"3143ca91-b1dc-43ec-a1e7-c02d2639911b","resolution":{"observed_at":"2026-08-15T18:32:40.156702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.160867Z","title":"On the likelihood that one unknown probability exceeds another in view of the evidence of two samples","venue":null,"work_id":null,"year":1933},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.160867Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:80101eab9e437b16b041b9f24ba5f62adff2ec8d4abb234fcf15d181eb4c1d94","observation_id":"71f2ed06-1271-4455-9156-ee0d3051093c","resolution":{"observed_at":"2026-08-15T18:32:40.160867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.165213Z","title":"Visualizing data using t-sne","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.165213Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:539a94b6468449175f03d5974853c6ff20c0e7e704cdf4e131e7fbf184c71b06","observation_id":"a83b18f4-fbf3-4d7f-90e8-b0f81ef75be3","resolution":{"observed_at":"2026-08-15T18:32:40.165213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.169224Z","title":"Optimal transport: old and new, volume 338","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.169224Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:97a24d78799d72c9c1b18da9e79aab718cc16134c46877710b61a38b67412e46","observation_id":"15e6ab30-2a48-43eb-b6ac-c2a29eb60fea","resolution":{"observed_at":"2026-08-15T18:32:40.169224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.581624Z","title":"Deir: efficient and robust exploration through discriminative-model-based episodic intrinsic rewards","venue":null,"work_id":"3f7768c0-dd87-467e-88ee-6544e91df0f5","year":2023},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.173411Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:d807596dcbba7d2ed19397010fdfcc5a3f2618edb41fd586016d6ac4d1d7600b","observation_id":"fa81e1a2-016c-43b9-b73d-4e0f79ad6e60","resolution":{"observed_at":"2026-08-15T18:32:40.585948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13897","last_updated":"2021-05-02T15:53:04Z","snapshot_observed_at":"2026-08-16T19:02:46.025088Z","submitted_at":"2020-11-27T18:40:03Z","title":"Latent Skill Planning for Exploration and Transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.13897","snapshot_observed_at":"2026-08-15T18:32:40.177666Z","title":"Latent skill planning for exploration and transfer","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.177666Z"},"links":{"cited_paper":"/paper/2011.13897","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:41eb2f394cb8933de4df397ffdf89b9ac2e1a5df55019afc0d57f0924303935e","observation_id":"e1a3930a-5842-4179-bae7-806fb321aeb1","resolution":{"observed_at":"2026-08-15T18:32:40.177666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.568177Z","title":"Behavior contrastive learning for unsupervised skill discovery","venue":null,"work_id":"130721e3-4e1d-4d98-a9e8-91af57cec3f8","year":2023},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.182230Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:a56a12461d66ff6a05a0944bf4bd947b4c5e0fd6915ac31e176995ffe9471a7a","observation_id":"7771b5d7-dd9b-4e34-9e58-c9f6271186a2","resolution":{"observed_at":"2026-08-15T18:32:40.572395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.554290Z","title":"Improving sample efficiency in model-free reinforcement learning from images","venue":null,"work_id":"2858182a-4bbb-442a-940e-392a7fee46bb","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.186599Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:6fcf92c44debbbbcefccab28d2476e9065253f56ea0360b880d16a28846357ac","observation_id":"8161ef56-b8b8-4411-a91a-0f72759e26c7","resolution":{"observed_at":"2026-08-15T18:32:40.559213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.539591Z","title":"Robust task representations for offline meta-reinforcement learning via contrastive learning","venue":null,"work_id":"8fb89db6-04a3-431a-89e2-24f83d1598e7","year":2022},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.190853Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:7fe9d5d7c59754a3aaab1cbe21ecf74d85550751d025e33625931623f7044516","observation_id":"8da12f06-a371-4d21-8dab-9411d69ae48b","resolution":{"observed_at":"2026-08-15T18:32:40.544440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.524275Z","title":"Learning invariant representations for reinforcement learning without reconstruction","venue":null,"work_id":"3a996045-814e-4729-93c0-0d86f03b3ea8","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.195132Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:9f402f9bc5723f24c497986ef5862039ea4f8d39ca9be420d374387599e6dab2","observation_id":"0a17c58b-b26f-4638-b63e-11b4cbf2703a","resolution":{"observed_at":"2026-08-15T18:32:40.528794Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.510196Z","title":"Learning robust state abstractions for hidden-parameter block mdps","venue":null,"work_id":"65e79f2b-be01-407b-ab2f-97af352e65b7","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.199693Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:41748baaefc402b816a1c2db4ca71510eee2de6d6c5083680953e56631f0bbb1","observation_id":"6be57525-f21b-4078-8e91-f1c8a0d14bb3","resolution":{"observed_at":"2026-08-15T18:32:40.514803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.495273Z","title":"Metacure: Meta reinforcement learning with empowerment-driven exploration","venue":null,"work_id":"c4a4a327-fbab-43c5-9cac-76ddf6caead1","year":null},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.203951Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:ed009c6b23bf4ef298ced6afe69475a604fbf24157df17fafde341b489ebd2e6","observation_id":"219092f9-0b37-46d9-bb1d-c1e167879511","resolution":{"observed_at":"2026-08-15T18:32:40.500117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.480378Z","title":"What can learned intrinsic rewards capture? In International Conference on Machine Learning, pp.\\ 11436--11446","venue":null,"work_id":"138dec29-0a66-4bd8-af5a-20088122a2e2","year":2020},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.208559Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:85f9de4061b05edd7874626c51b2c902afdb11069310dafd90d25fe68b0c55ca","observation_id":"25accc56-a6ff-4d6a-90a1-a6499d61705b","resolution":{"observed_at":"2026-08-15T18:32:40.485104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.08348","last_updated":"2020-02-27T19:40:21Z","snapshot_observed_at":"2026-08-11T22:18:09.221124Z","submitted_at":"2019-10-18T11:44:59Z","title":"VariBAD: A Very Good Method for Bayes-Adaptive Deep RL via Meta-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.08348","snapshot_observed_at":"2026-08-15T18:32:40.212901Z","title":"Varibad: A very good method for bayes-adaptive deep rl via meta-learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.212901Z"},"links":{"cited_paper":"/paper/1910.08348","citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:4e21497c835ce04afd8ec5a26759616c087c5e117cc9769787f61b510711b7de","observation_id":"24750245-12b6-422a-8776-d0a684856296","resolution":{"observed_at":"2026-08-15T18:32:40.212901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.465159Z","title":"Exploration in approximate hyper-state space for meta reinforcement learning","venue":null,"work_id":"d32ac1fa-fd49-4041-9fa0-09aca8d6c822","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.217411Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:31725d07427be614d6a05f186f71b6298fb5899c92fc818bf0cb2473e7235306","observation_id":"19a1dfa5-ef8d-43a4-8f8b-11e91e86f0e1","resolution":{"observed_at":"2026-08-15T18:32:40.470555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.221543Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.221543Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:ca6f89c9433b63261c0fbbddb7159d1cde523534d32bc5ecf30b0fae8758a51b","observation_id":"7fad10b7-cd78-4d93-974d-a1c7240ca4d7","resolution":{"observed_at":"2026-08-15T18:32:40.221543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.226987Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.226987Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:510f7b70ebb42fe005584706ec23c7d770848a9c9492be26d2e59cd46c5f3d12","observation_id":"f70d99ba-16c6-4912-8398-c45ae50d6f00","resolution":{"observed_at":"2026-08-15T18:32:40.226987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.232224Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.232224Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:9b4c011c6251b894ac1e51b57ff638c2fd4bf3fe2f43357bca3176889384214b","observation_id":"87f6b0d0-3206-495b-b8e1-394e7acc3c3c","resolution":{"observed_at":"2026-08-15T18:32:40.232224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T18:32:40.421884Z","title":"iӆVb ߛuѪZ̮' No` ԰r tVXo+Ra 4ON i]auד/Ut a l B j*f o v1 ZM1 P' i .B e L w`CN` t 翧FS&yDĖ ]","venue":null,"work_id":"345e64be-ac75-4620-b782-dce570feea1d","year":2021},"citing_paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-15T18:32:40.237195Z"},"links":{"citing_paper":"/paper/2506.19785"},"observation_digest":"sha256:fcf4cc3e8fadf55890938c1f5a212643143ce7be9457e67fe169c951f7d0591a","observation_id":"4a8e40ea-f772-48aa-884f-7ec853c96a4b","resolution":{"observed_at":"2026-08-15T18:32:40.427462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.19785","last_updated":"2025-06-24T16:52:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-18T06:32:02.025872Z","submitted_at":"2025-06-24T16:52:00Z","title":"Learning Task Belief Similarity with Latent Dynamics for Meta-Reinforcement Learning"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":26},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2506.19785."}