{"as_of":"2026-08-14T21:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9a62cdab4d9bbbadfb1e1a2ad6cb3609ab3f843e8d59b1f0ec42d779a849722d","coverage":[{"denominator":115,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T18:52:14.267276Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.11188/citation-record","integrity":"/paper/2411.11188/integrity","json":"/paper/2411.11188/citation-record.json","paper":"/paper/2411.11188"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T18:52:13.668347Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.668347Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:05b04022fe4c0c6f5f3f3c2a17bf9bb301cdefadf22999145b18e6db793f1eb2","observation_id":"e8e0bd80-46b7-4095-b31e-52f844125d5c","resolution":{"observed_at":"2026-08-12T18:52:13.668347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T18:52:13.676180Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.676180Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:06f48f2cd9198936d5796106e5c668aac3fdedde2f8ecd0e66df26749afee2df","observation_id":"05dda284-faf6-4911-a71d-0d410a77a4aa","resolution":{"observed_at":"2026-08-12T18:52:13.676180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.682241Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.682241Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:f5c8b2604a885c4ab6a2e30229edbae32a5ebc9e9209215986aa4157bbbf357d","observation_id":"49da78f8-9557-499f-8629-c96cf50d96bd","resolution":{"observed_at":"2026-08-12T18:52:13.682241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-12T18:52:13.687863Z","title":"Measuring mathematical problem solving with the math dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.687863Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:9de628bae26d2a47eb4eeae678e297b2c5e01dfc376cf5b6c8c7d4351ac21c86","observation_id":"bbc0b27e-1e77-473e-8e46-9429c7e20594","resolution":{"observed_at":"2026-08-12T18:52:13.687863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.693725Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.693725Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:1e79aee6a9290a346743914eb8fb23062f3958cb62d5ae0d1799a5f3bcd7996d","observation_id":"e75d7813-8482-4d6c-8f6b-87f9be6a9108","resolution":{"observed_at":"2026-08-12T18:52:13.693725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.699688Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.699688Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:62ed78e92893bdd2712c96e6b3355909de919c1496088dc8a5216787d1c4ba3d","observation_id":"4434356d-25ae-4953-b72b-1762d949a30e","resolution":{"observed_at":"2026-08-12T18:52:13.699688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04458","last_updated":"2024-01-09T13:38:35Z","snapshot_observed_at":"2026-08-13T15:15:49.512222Z","submitted_at":"2022-12-08T18:30:22Z","title":"General-Purpose In-Context Learning by Meta-Learning Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04458","snapshot_observed_at":"2026-08-12T18:52:13.705774Z","title":"General-purpose in-context learning by meta-learning transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.705774Z"},"links":{"cited_paper":"/paper/2212.04458","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:6cd54f8ad963f21b6073a08733080e3c50a8310fec75cf61d2ef6b046d45b4e8","observation_id":"9d5b0903-fdf8-430b-8e54-bbf25f0dc599","resolution":{"observed_at":"2026-08-12T18:52:13.705774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.08028","last_updated":"2025-05-29T14:17:01Z","snapshot_observed_at":"2026-08-13T13:01:56.349327Z","submitted_at":"2023-01-19T12:01:41Z","title":"A Tutorial on Meta-Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.08028","snapshot_observed_at":"2026-08-12T18:52:13.713049Z","title":"A survey of meta-reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.713049Z"},"links":{"cited_paper":"/paper/2301.08028","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ca7b7368822f669d28666adfdeb8b189c4c60355cae3e9b5feebf30719287c7f","observation_id":"3a9e2440-3a00-405a-8262-17c0cc20c2eb","resolution":{"observed_at":"2026-08-12T18:52:13.713049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.05763","last_updated":"2017-01-23T12:38:24Z","snapshot_observed_at":"2026-08-14T21:29:55.556068Z","submitted_at":"2016-11-17T16:29:11Z","title":"Learning to reinforcement learn","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.05763","snapshot_observed_at":"2026-08-12T18:52:13.719534Z","title":"Learning to reinforcement learn","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.719534Z"},"links":{"cited_paper":"/paper/1611.05763","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:3a355f25ac3eaa59f60a8d32cb05139ecc6cf02292a5ab48bbb3cb3a3b647193","observation_id":"9386996f-6c27-45d4-9bb4-bd3c89165e14","resolution":{"observed_at":"2026-08-12T18:52:13.719534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02779","last_updated":"2016-11-10T01:17:36Z","snapshot_observed_at":"2026-08-14T21:31:19.001119Z","submitted_at":"2016-11-09T00:13:29Z","title":"RL$^2$: Fast Reinforcement Learning via Slow Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02779","snapshot_observed_at":"2026-08-12T18:52:13.725415Z","title":"Rl 2: Fast reinforcement learning via slow reinforcement learning","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.725415Z"},"links":{"cited_paper":"/paper/1611.02779","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:bc37b899bbdeb64a3a52ef6f31213152713a3cc791a233eafe068e610c7ad114","observation_id":"05e9fb36-fa36-49a0-9cb3-794e5bd0746e","resolution":{"observed_at":"2026-08-12T18:52:13.725415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06424","last_updated":"2019-10-22T15:54:03Z","snapshot_observed_at":"2026-08-14T16:31:36.530468Z","submitted_at":"2019-05-15T20:21:14Z","title":"Meta reinforcement learning as task inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.06424","snapshot_observed_at":"2026-08-12T18:52:13.731509Z","title":"Meta reinforcement learning as task inference","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.731509Z"},"links":{"cited_paper":"/paper/1905.06424","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:3270f9805a3c6c37b4e98753220905164b3af9837d95b1f6dff92230309f5690","observation_id":"0141d06f-1926-4f04-a71a-84956b218469","resolution":{"observed_at":"2026-08-12T18:52:13.731509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.737308Z","title":"Why generalization in rl is difficult: Epistemic pomdps and implicit partial observability","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.737308Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:6d85976aa806c704b08bc3aaeb09b0b96c4ae94441677109fd85f23c8d2a87cc","observation_id":"6d4d9a59-4681-4b4b-8312-dee93cfffec8","resolution":{"observed_at":"2026-08-12T18:52:13.737308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.743182Z","title":"Fast adaptation via meta reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.743182Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:e7fa29d8c59458f9bd65f661466398b229e8a00f5942e4a6264508a8bb5a403f","observation_id":"75f82e5a-f91b-4d35-bad6-a970dc0a5299","resolution":{"observed_at":"2026-08-12T18:52:13.743182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.748420Z","title":"On the effectiveness of fine-tuning versus meta-reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.748420Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:8ce8f9ad64472c4e61b6a18faf279538dca78ea43f6c6fe53aa78831df1d6d21","observation_id":"ae957ae0-b31d-4fdc-ac69-280bc4f786f5","resolution":{"observed_at":"2026-08-12T18:52:13.748420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.754516Z","title":"Investigating multi-task pretraining and generalization in reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.754516Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:2f5c277da947fbefac4d3847a8833741f42fa06774b2fa26990e22e7dc90bd3a","observation_id":"9a7ec438-04e2-4132-9ae2-5c74415452c7","resolution":{"observed_at":"2026-08-12T18:52:13.754516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.759835Z","title":"Probing transfer in deep reinforcement learning without task engineering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.759835Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:c7468d070288fd49fb1a45c09fb9a51ddc120afa6d8caeac3cde69f206b21819","observation_id":"ae323eb4-673d-462a-9ec0-d3908200396f","resolution":{"observed_at":"2026-08-12T18:52:13.759835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.765004Z","title":"Meta-world: A benchmark and evaluation for multi-task and meta reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.765004Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7c6732339681753ffca3e95a3b92f2bd96147e32cec9a0bfa12e4eabe5ab2d5b","observation_id":"c6689f07-2af1-4734-8e3e-3d3310c15ca7","resolution":{"observed_at":"2026-08-12T18:52:13.765004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.771349Z","title":"Parameterizing non-parametric meta- reinforcement learning tasks via subtask decomposition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.771349Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:11c4a54ccb4f3871f6ee96f222e8c748c7e28b018c213e7d35fbae9f60900210","observation_id":"6ddaee37-bae2-4353-a420-4ccf773de6ec","resolution":{"observed_at":"2026-08-12T18:52:13.771349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.776671Z","title":"A generalist agent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.776671Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:8c159c65efc028497b2f026ad177589c436b0240487b748286c65ebf22b663ee","observation_id":"36b52613-82cf-443a-a264-64b9ab0281ee","resolution":{"observed_at":"2026-08-12T18:52:13.776671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.781951Z","title":"Td-mpc2: Scalable, robust world models for continuous control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.781951Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7fa9454f7a238356aa11aed8ac93ef618ae2531957515a7723e4247360634d09","observation_id":"4778cf66-0123-4d1f-b360-89455572b3cf","resolution":{"observed_at":"2026-08-12T18:52:13.781951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09844","last_updated":"2024-07-10T15:56:14Z","snapshot_observed_at":"2026-08-14T02:14:31.024405Z","submitted_at":"2024-02-15T10:01:55Z","title":"Jack of All Trades, Master of Some, a Multi-Purpose Transformer Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09844","snapshot_observed_at":"2026-08-12T18:52:13.786952Z","title":"Jack of all trades, master of some, a multi-purpose transformer agent.arXiv preprint arXiv:2402.09844, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.786952Z"},"links":{"cited_paper":"/paper/2402.09844","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ddd28419cd54bf1e6a0172aa3f9ec43a43f23d11f1c4f9dbfea275b1b11d8022","observation_id":"904eedf9-7dcf-45d2-946e-915fca177539","resolution":{"observed_at":"2026-08-12T18:52:13.786952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.792491Z","title":"Causes and cures for interference in multilingual translation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.792491Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:57d5da3ac5d36e10306e7fe73c37f548970e0e1f7a8df5782a15de8841db47c3","observation_id":"a9aa7c6f-2f97-4aa3-bb3e-59c424a31c54","resolution":{"observed_at":"2026-08-12T18:52:13.792491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.797323Z","title":"Do current multi-task optimization methods in deep learning even help? Advances in neural information processing systems, 35:13597–13609, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.797323Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:3cc2f5aff91a458211f9f9f2ac1cf89e98384b839d6864557c9ebfb56539e9dd","observation_id":"10546290-e15b-4d83-b94a-d562be23b710","resolution":{"observed_at":"2026-08-12T18:52:13.797323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.802981Z","title":"A survey on multi-task learning.IEEE Transactions on Knowledge and Data Engineering, 34(12):5586–5609, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.802981Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:968a8f6dcd7e0c4b2e6a41ff7554b6cbc99dd33cc8de5d6b4cb374dc37e85656","observation_id":"944f304a-9ec7-47e3-a835-bcc17648db2e","resolution":{"observed_at":"2026-08-12T18:52:13.802981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.808387Z","title":"Multi-task deep reinforcement learning with popart","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.808387Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:9c0c5ad55c8d29a8532ce9c8ebd102527b5f65d01ab7146506b1f593f12531a4","observation_id":"e0c3b2eb-2836-4fc3-894b-0a6ed00b3e7a","resolution":{"observed_at":"2026-08-12T18:52:13.808387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.813217Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.813217Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:823c9303fff5e32ec0e1b7623930b64475f63a646493b6d571231428d4e980e4","observation_id":"2e3352f0-beec-4735-8372-ccb96d06b233","resolution":{"observed_at":"2026-08-12T18:52:13.813217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.818614Z","title":"POP- Gym: Benchmarking partially observable reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.818614Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:b3abc2a4d36aea7e507abbc5190f384018ae7a3cc7ffcc3e53e392e8a4888dbe","observation_id":"2f447331-c154-42e9-be41-834f0b3799e4","resolution":{"observed_at":"2026-08-12T18:52:13.818614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.823473Z","title":"Leveraging procedural generation to benchmark reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.823473Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:2007d57fd3ef5df69913de6fcdfad725b8a3cbd2f6a3127612a9f494b8ab2861","observation_id":"26a048a4-8529-46cc-8d56-afc4bd020cba","resolution":{"observed_at":"2026-08-12T18:52:13.823473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.829519Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.829519Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:44d242f0974116ce2d5ef5c59eaeca005a30fd13e44fef5b7bf0ce0a8112d986","observation_id":"1500257d-40f2-4bc8-87d9-ec565e7886e9","resolution":{"observed_at":"2026-08-12T18:52:13.829519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.835296Z","title":"BabyAI: First steps towards grounded language learning with a human in the loop","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.835296Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:f83372bf5a398df534787ac48cd66493d35724c26084986579d108f2f269bacb","observation_id":"15e7bd5d-cd16-4983-9fe3-2524d5b27e33","resolution":{"observed_at":"2026-08-12T18:52:13.835296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.04104","last_updated":"2024-04-17T17:41:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-10T18:12:16Z","title":"Mastering Diverse Domains through World Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.04104","snapshot_observed_at":"2026-08-12T18:52:13.848521Z","title":"Mastering diverse domains through world models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.848521Z"},"links":{"cited_paper":"/paper/2301.04104","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:658cc7484e1f79ac51f568611cf3612530966b63a3e608d65d646792288dbe5b","observation_id":"f4ec06d1-cdc6-42cb-b1a9-c38740e4aa99","resolution":{"observed_at":"2026-08-12T18:52:13.848521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.854092Z","title":"Critic regularized regression","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.854092Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:f845ce42445dbd66a332e37f42dba5b71e7d344b0872d1f7b60a223765f2607d","observation_id":"69fa1a5f-15f6-4143-ab69-aed23f239655","resolution":{"observed_at":"2026-08-12T18:52:13.854092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.860277Z","title":"Q-transformer: Scalable offline reinforcement learning via autoregressive q-functions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.860277Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:db95a00080984c6b49750bb1d28c971120e84fe0e9acfa3f56ff98397af57438","observation_id":"a0942997-0900-4dcd-8960-e3a8533a98d0","resolution":{"observed_at":"2026-08-12T18:52:13.860277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03950","last_updated":"2024-03-06T18:55:47Z","snapshot_observed_at":"2026-08-13T04:01:59.075605Z","submitted_at":"2024-03-06T18:55:47Z","title":"Stop Regressing: Training Value Functions via Classification for Scalable Deep RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03950","snapshot_observed_at":"2026-08-12T18:52:13.865883Z","title":"Stop re- gressing: Training value functions via classification for scalable deep rl","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.865883Z"},"links":{"cited_paper":"/paper/2403.03950","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ac887a62b7c0433873665615eb0579fd2caff7eb2fa3ef974407ff5e201f87df","observation_id":"c71c2a29-414d-4a20-8954-c0afeeaacee4","resolution":{"observed_at":"2026-08-12T18:52:13.865883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05546","last_updated":"2024-02-08T10:29:46Z","snapshot_observed_at":"2026-08-13T04:23:32.646495Z","submitted_at":"2024-02-08T10:29:46Z","title":"Offline Actor-Critic Reinforcement Learning Scales to Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05546","snapshot_observed_at":"2026-08-12T18:52:13.872247Z","title":"Offline actor-critic reinforcement learning scales to large models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.872247Z"},"links":{"cited_paper":"/paper/2402.05546","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7f5984c7ccf5b15d159563eb151c210614f394a7adca58e388411e696c3dd04e","observation_id":"f3783051-a2a2-4173-8796-850d8c7f8e47","resolution":{"observed_at":"2026-08-12T18:52:13.872247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.877904Z","title":"Decision transformer: Reinforcement learning via sequence modeling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.877904Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:887d467911eca4bdfcf29a158ccfe66f40f9920ee72a6d1d1f2a0ee48e1ab00f","observation_id":"da8586df-f0c5-4ccb-9a30-e6c1621bedbf","resolution":{"observed_at":"2026-08-12T18:52:13.877904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.884533Z","title":"Multi-game decision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.884533Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:d50327c89664f9b3f7e5867e43b44fbab75f775a9fc78b5ffcea89f216515a29","observation_id":"1476d655-eea4-42df-8706-553ae7a1c6a8","resolution":{"observed_at":"2026-08-12T18:52:13.884533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1502.02259","last_updated":"2015-02-08T14:58:50Z","snapshot_observed_at":"2026-08-03T17:17:59.241164Z","submitted_at":"2015-02-08T14:58:50Z","title":"Contextual Markov Decision Processes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1502.02259","snapshot_observed_at":"2026-08-12T18:52:13.891027Z","title":"Contextual markov decision processes","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.891027Z"},"links":{"cited_paper":"/paper/1502.02259","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:e2b54a9ba2107cf0d94fd5d6acdd463f37870960e4fc7bff5699d4ec764ec1d6","observation_id":"b56488e7-2e14-4a2b-a26e-35431ad280ba","resolution":{"observed_at":"2026-08-12T18:52:13.891027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.896816Z","title":"Reinforcement learning, fast and slow","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.896816Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7533076fc4bac0c456939de5cd1072a6a80ecb3dcde27dbb51403cce6dd1eca0","observation_id":"5a809e27-e247-47c1-9ff3-1f70f5133f93","resolution":{"observed_at":"2026-08-12T18:52:13.896816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.903305Z","title":"A survey of generalisa- tion in deep reinforcement learning, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.903305Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:da2d8077860907c17ee9638b47fba359f07345dadda0fff996104b6af6a5167a","observation_id":"7f8f0c28-4a0b-4e8a-941a-e6e6d9f3924f","resolution":{"observed_at":"2026-08-12T18:52:13.903305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04500","last_updated":"2023-06-02T15:48:13Z","snapshot_observed_at":"2026-08-14T16:14:24.463644Z","submitted_at":"2022-02-09T15:01:59Z","title":"Contextualize Me -- The Case for Context in Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04500","snapshot_observed_at":"2026-08-12T18:52:13.908894Z","title":"Contextualize me–the case for context in reinforcement learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.908894Z"},"links":{"cited_paper":"/paper/2202.04500","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:854c1049296b4e2a0c9a0dd048b2a7ec7084bea779d73a90a2ca7696cdfd1bd5","observation_id":"80d33c75-105c-46b1-9604-129ad6c61152","resolution":{"observed_at":"2026-08-12T18:52:13.908894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.914601Z","title":"Decoupling exploration and exploitation for meta-reinforcement learning without sacrifices","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.914601Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:3b6265911ef89024f62464306393f0b340cc8b98422c1015c677feb0beb095da","observation_id":"fde8b43d-e6ae-4e59-a0dc-e2a52a8f439a","resolution":{"observed_at":"2026-08-12T18:52:13.914601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.922360Z","title":"Efficient off-policy meta-reinforcement learning via probabilistic context variables","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.922360Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:5a88babb2efb0056a51a292fe3da62f57269e4af48305f741fa05a172c6f8550","observation_id":"23d35b38-4845-437e-88be-e9faec54aec2","resolution":{"observed_at":"2026-08-12T18:52:13.922360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03020","last_updated":"2024-06-01T22:35:29Z","snapshot_observed_at":"2026-08-14T20:32:22.515456Z","submitted_at":"2024-03-05T14:57:04Z","title":"SplAgger: Split Aggregation for Meta-Reinforcement Learning","version":3},"cited_work":{"arxiv_id":"2403.03020","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.03020","snapshot_observed_at":"2026-08-12T18:52:15.155660Z","title":"SplAgger: Split Aggregation for Meta-Reinforcement Learning","venue":"cs.LG","work_id":"822fcc4d-8e9d-4828-87bd-21c8541cfb5c","year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.928555Z"},"links":{"cited_paper":"/paper/2403.03020","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:5bd50a115690d2343387cc82a053dc10be36aa60112783b4e311ac40f793fbb2","observation_id":"aa82eda7-892c-4ac7-818f-8f9ccfa7238b","resolution":{"observed_at":"2026-08-12T18:52:15.161507Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.14215","last_updated":"2022-10-25T17:57:49Z","snapshot_observed_at":"2026-08-13T13:57:15.817919Z","submitted_at":"2022-10-25T17:57:49Z","title":"In-context Reinforcement Learning with Algorithm Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.14215","snapshot_observed_at":"2026-08-12T18:52:13.934956Z","title":"In-context reinforcement learning with algorithm distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.934956Z"},"links":{"cited_paper":"/paper/2210.14215","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:dd8cb6aa23ff6e16e235527e079ce54f981c6aa0472a0ba67b9355a5e6ca96d6","observation_id":"f8d59b58-f5a2-450d-b640-b7e6e2ac5490","resolution":{"observed_at":"2026-08-12T18:52:13.934956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.941854Z","title":"Supervised pretraining can learn in-context reinforcement learning.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.941854Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:36e898bc4f997fe931d4c99c90c68d816259b1b5c81987b7e933fdfa724ba036","observation_id":"795ed655-34de-4f8f-90dd-ef47b421d5c5","resolution":{"observed_at":"2026-08-12T18:52:13.941854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03801","last_updated":"2023-12-06T15:19:28Z","snapshot_observed_at":"2026-08-13T15:58:34.620927Z","submitted_at":"2023-12-06T15:19:28Z","title":"Generalization to New Sequential Decision Making Tasks with In-Context Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03801","snapshot_observed_at":"2026-08-12T18:52:13.946894Z","title":"Generalization to new sequential decision making tasks with in-context learning.arXiv preprint arXiv:2312.03801, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.946894Z"},"links":{"cited_paper":"/paper/2312.03801","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:90a0b84ee277a3d9b1182d63b0b57fc6ac5edce563452fb396a24e375f889c9a","observation_id":"e1accc20-a672-43d5-a96c-fde454f5b091","resolution":{"observed_at":"2026-08-12T18:52:13.946894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.952726Z","title":"Cross-episodic curriculum for transformer agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.952726Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:387f45db14eb74965f469652239d5d476f61a2871e7180a23bd08e0edbb80dbd","observation_id":"e3da48a4-0a9f-4e67-aa9b-f9fb8c6aec3f","resolution":{"observed_at":"2026-08-12T18:52:13.952726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.03141","last_updated":"2018-02-25T04:55:20Z","snapshot_observed_at":"2026-08-14T20:48:28.347456Z","submitted_at":"2017-07-11T06:21:31Z","title":"A Simple Neural Attentive Meta-Learner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.03141","snapshot_observed_at":"2026-08-12T18:52:13.958054Z","title":"A simple neural attentive meta-learner","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.958054Z"},"links":{"cited_paper":"/paper/1707.03141","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:c57313ff349b818ec67e16fc0df362e26104501b5a7c8c779e26d50691ef890f","observation_id":"36832bb8-cf1a-4b4d-8f8f-f8c695a10519","resolution":{"observed_at":"2026-08-12T18:52:13.958054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.963612Z","title":"Transformers are meta-reinforcement learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.963612Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:22d25d4da8d69820181ff1afd87e8f68dd31dabba9383337ce4e93bcbb3ff9d9","observation_id":"769ffa6c-7b6c-4cd3-93c8-48ae1742e698","resolution":{"observed_at":"2026-08-12T18:52:13.963612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03982","last_updated":"2023-11-23T16:02:22Z","snapshot_observed_at":"2026-08-13T12:29:49.433406Z","submitted_at":"2023-03-07T15:32:18Z","title":"Structured State Space Models for In-Context Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03982","snapshot_observed_at":"2026-08-12T18:52:13.969192Z","title":"Structured state space models for in-context reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.969192Z"},"links":{"cited_paper":"/paper/2303.03982","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:bc76cab116b8e93d86f15bd74114b19990b0c07ba39219dbb4f368823e6f944b","observation_id":"8b551f16-99b3-442f-b236-dc6811fb8fac","resolution":{"observed_at":"2026-08-12T18:52:13.969192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00125","last_updated":"2020-04-04T10:38:40Z","snapshot_observed_at":"2026-08-09T11:33:51.574385Z","submitted_at":"2019-09-30T21:50:32Z","title":"Meta-Q-Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00125","snapshot_observed_at":"2026-08-12T18:52:13.975612Z","title":"Meta-q-learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.975612Z"},"links":{"cited_paper":"/paper/1910.00125","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:72286c8367c02a293bdfcc84d5f00cb4bbcdc8c41e39cb51c0b56a6545f554c9","observation_id":"9fa0c36e-b606-4133-8923-867a80f229b4","resolution":{"observed_at":"2026-08-12T18:52:13.975612Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.12628","last_updated":"2021-10-25T04:08:57Z","snapshot_observed_at":"2026-08-13T17:47:17.133313Z","submitted_at":"2021-10-25T04:08:57Z","title":"Recurrent Off-policy Baselines for Memory-based Continuous Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.12628","snapshot_observed_at":"2026-08-12T18:52:13.984040Z","title":"Recurrent off-policy baselines for memory-based continuous control","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.984040Z"},"links":{"cited_paper":"/paper/2110.12628","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:42a29bbea970f8e28f3ca16bafc5a8c11f230471f9a76ec8edcda503c92a50b4","observation_id":"d7419ac3-2b53-4f01-a6f7-f0be2b0c8c3c","resolution":{"observed_at":"2026-08-12T18:52:13.984040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:13.990510Z","title":"Recurrent model-free rl can be a strong baseline for many pomdps, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.990510Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ef6044816437b4e64dc21d4ca2409fabaa2bb0e5e141cdb8b715932642209bb1","observation_id":"f437edf0-7e58-4821-b559-f89f418ba7ae","resolution":{"observed_at":"2026-08-12T18:52:13.990510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07608","last_updated":"2023-01-18T15:39:21Z","snapshot_observed_at":"2026-08-13T13:02:28.295648Z","submitted_at":"2023-01-18T15:39:21Z","title":"Human-Timescale Adaptation in an Open-Ended Task Space","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.07608","snapshot_observed_at":"2026-08-12T18:52:13.998904Z","title":"Human-timescale adaptation in an open-ended task space","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:13.998904Z"},"links":{"cited_paper":"/paper/2301.07608","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7b48f442949797b55542a127c6c06d4892ed890ea22776ed09a0243540abd6d1","observation_id":"59694b9e-4ca7-435e-b5ea-3798c94b47cc","resolution":{"observed_at":"2026-08-12T18:52:13.998904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03864","last_updated":"2023-11-03T14:54:25Z","snapshot_observed_at":"2026-08-13T10:59:57.150570Z","submitted_at":"2023-07-07T23:34:12Z","title":"When Do Transformers Shine in RL? Decoupling Memory from Credit Assignment","version":4},"cited_work":{"arxiv_id":"2307.03864","doi":null,"metadata_source":"pith","pith_arxiv_id":"2307.03864","snapshot_observed_at":"2026-08-12T18:52:14.973094Z","title":"When Do Transformers Shine in RL? Decoupling Memory from Credit Assignment","venue":"cs.LG","work_id":"bc1c4b4f-d666-4c56-9a95-bb4320bf487f","year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.005438Z"},"links":{"cited_paper":"/paper/2307.03864","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:915818cd8e311ff286a007ce369a902d2665260a0c3382b0246d950644dda661","observation_id":"10992ff8-83f8-4003-ad4f-dac0fea02bff","resolution":{"observed_at":"2026-08-12T18:52:14.981634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:14.011684Z","title":"AMAGO: Scalable in-context reinforcement learning for adaptive agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.011684Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:528ef88c76228d41e979cc890635ca4a49a25c31449c474306a0d5527da6c845","observation_id":"e36b5f86-4e2c-4ff3-afc3-9297bc80b22d","resolution":{"observed_at":"2026-08-12T18:52:14.011684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.02224","last_updated":"2020-11-25T19:33:00Z","snapshot_observed_at":"2026-08-14T17:47:51.883746Z","submitted_at":"2018-12-05T21:00:44Z","title":"Adapting Auxiliary Losses Using Gradient Similarity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.02224","snapshot_observed_at":"2026-08-12T18:52:14.024598Z","title":"Adapting auxiliary losses using gradient similarity","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.024598Z"},"links":{"cited_paper":"/paper/1812.02224","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ec78ebacef79faa02caa939aabd63730ca6a87b5614de1d4cfcdf19c80a184fc","observation_id":"9d71639f-e0ec-4165-980d-be6daf29f515","resolution":{"observed_at":"2026-08-12T18:52:14.024598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:14.030095Z","title":"Gradient surgery for multi-task learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.030095Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:a5117dd6022f20621b33c45ed02b2fc7c24386990df2925d9fee126641abd587","observation_id":"4d53ec87-68b4-4876-b5c0-7dde6060fd17","resolution":{"observed_at":"2026-08-12T18:52:14.030095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.210253Z","title":"Robust optimization for multilingual translation with imbalanced data","venue":null,"work_id":"350e958f-2776-4042-b630-16d04118ce12","year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.035251Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:b764521aafb1a579180f0e7a24f56e24ba0d2d9c1a35c4be87ff97322cbdb993","observation_id":"68c53fcf-1fcc-419b-8ee0-d902726c25ec","resolution":{"observed_at":"2026-08-12T18:52:16.216218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.186190Z","title":"Gradient vaccine: Investigating and improving multi-task optimization in massively multilingual models","venue":null,"work_id":"294e30d6-d13a-4822-a524-69cc8811781c","year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.040504Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:6bb4f272aed868cc683e7eed4eca98d0052fd7bff2efe1009d4f0207180b8908","observation_id":"21d8989e-6f91-4701-8c68-b301f92eebad","resolution":{"observed_at":"2026-08-12T18:52:16.194513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.164954Z","title":"Conflict-averse gradient descent for multi-task learning","venue":null,"work_id":"505cb2bc-d765-48c1-a391-8860fdcb27fe","year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.045701Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:da70ab724de9918ab3b51f811f2490a29729ff3ad75020258aa451a5ec162876","observation_id":"8c9a9c73-7c3c-4fa8-ab11-d80a27965fd7","resolution":{"observed_at":"2026-08-12T18:52:16.171388Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.139470Z","title":"Scalarization for multi- task and multi-domain learning at scale","venue":null,"work_id":"62738b8c-21a9-48d5-8500-1b7fcb619dd0","year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.050944Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:23141fc16ec1cddbab392d9b3df73728391ea50fc32bff3fb81c3ca062102736","observation_id":"300a223b-15e4-4485-a9b4-1a8e27354a8c","resolution":{"observed_at":"2026-08-12T18:52:16.146118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.110773Z","title":"In defense of the unitary scalarization for deep multi-task learning","venue":null,"work_id":"945c1aa3-aa70-4c8c-b17b-778c8bf150da","year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.056075Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:1ac9bf4d51561ef258548c6be58dcd666282f37e8d575d9e4ae3afbaac8b3458","observation_id":"d71cc37b-aeb5-4762-8b9b-5a8435d3a2db","resolution":{"observed_at":"2026-08-12T18:52:16.117141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.091144Z","title":"Multi-task reinforcement learning with context-based representations","venue":null,"work_id":"101e9a62-6abc-4447-9c63-dc28024af0fb","year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.061317Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:4c55bc7a661232cc46bfcd18e9ffabc5e24ac6dc899f122465f6f0cb9419faaa","observation_id":"4760a181-8cd2-43ab-bfc1-cab6de7810a4","resolution":{"observed_at":"2026-08-12T18:52:16.096948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.070970Z","title":"Offline q-learning on diverse multi-task data both scales and generalizes","venue":null,"work_id":"ea2856ec-1d07-456c-91ff-acdaa311cb21","year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.066393Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:eb1a559e044c5c5b30823c00ece3b401490bb4361df32f80411442f778390c49","observation_id":"d34a9fbc-e683-48a0-9b6c-654bb3b5ebe9","resolution":{"observed_at":"2026-08-12T18:52:16.077206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09561","last_updated":"2024-01-17T19:31:21Z","snapshot_observed_at":"2026-08-13T04:40:21.226266Z","submitted_at":"2024-01-17T19:31:21Z","title":"Sharing Knowledge in Multi-Task Deep Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09561","snapshot_observed_at":"2026-08-12T18:52:14.071683Z","title":"Sharing knowledge in multi-task deep reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.071683Z"},"links":{"cited_paper":"/paper/2401.09561","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:88a417c4eeb84d8596cd7f0fe9b15e40844a9c6a2bf329cf7091a7aa78b49d85","observation_id":"8bda6a36-5226-4606-a416-47927d01d159","resolution":{"observed_at":"2026-08-12T18:52:14.071683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.047246Z","title":"Garage: A toolkit for reproducible reinforcement learning research","venue":null,"work_id":"56f7e83a-2f2f-482a-8e6a-e3a81e73dbb6","year":2019},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.077320Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:c25a79f96861a48694abe7892788d2a1e5fab82cc42781afe02f0dba62a402ef","observation_id":"8d6910c1-9afa-4aff-9214-98165f8c2445","resolution":{"observed_at":"2026-08-12T18:52:16.054393Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.01118","last_updated":"2019-01-11T20:26:59Z","snapshot_observed_at":"2026-08-14T19:40:02.936661Z","submitted_at":"2018-03-03T07:13:43Z","title":"Some Considerations on Learning to Explore via Meta-Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.01118","snapshot_observed_at":"2026-08-12T18:52:14.083932Z","title":"Some considerations on learning to explore via meta-reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.083932Z"},"links":{"cited_paper":"/paper/1803.01118","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:1d85e3927f73101220e7eddf6a91a96725a9f67b81d74b19578c314ee531a594","observation_id":"19636b8f-941d-4a48-b0f4-4624ffb2b3ed","resolution":{"observed_at":"2026-08-12T18:52:14.083932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:16.011636Z","title":"Model-agnostic meta-learning for fast adaptation of deep networks","venue":null,"work_id":"b4331e29-637e-49a7-8038-d829b11a70bb","year":null},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.091439Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:0718de91fc1609fcec1dd0d48256b8ac7f278038075b78f1c50d847885637d8c","observation_id":"66a26dcc-862f-42ac-a092-41bbe8637ae5","resolution":{"observed_at":"2026-08-12T18:52:16.018265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.06784","last_updated":"2022-02-11T12:46:43Z","snapshot_observed_at":"2026-08-14T18:14:08.355872Z","submitted_at":"2018-10-16T01:43:51Z","title":"ProMP: Proximal Meta-Policy Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.06784","snapshot_observed_at":"2026-08-12T18:52:14.098293Z","title":"Promp: Proximal meta-policy search","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.098293Z"},"links":{"cited_paper":"/paper/1810.06784","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:1c4954f75a4a9810c50c77d6c0968981fdb582cbb6c97760562d1f5233501561","observation_id":"2a8d6d15-ec1c-45c4-80fb-75176fcb6dd5","resolution":{"observed_at":"2026-08-12T18:52:14.098293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.977221Z","title":"MAMBA: an effective world model approach for meta-reinforcement learning","venue":null,"work_id":"21d0c5e2-cdda-4e2b-8ff8-f3115a4f02e7","year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.103638Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:93eb8c1cbc1fc2fff36bc3ba1cec8e0c5e792e7570ead6a65f68606029f7102b","observation_id":"ad09dbf1-5851-4024-b783-635c4853c9f2","resolution":{"observed_at":"2026-08-12T18:52:15.988252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.950361Z","title":"Alchemy: A benchmark and analysis toolkit for meta-reinforcement learning agents","venue":null,"work_id":"cd1a26d2-2f90-4cd0-a9c7-46464c30f1be","year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.109463Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ff5f8c0e4afbafe68972b8490d1534a7e99ba4cf483bb3ecf95fe09e1f9eab62","observation_id":"d311d914-7230-44f8-8685-79c8a18ec79f","resolution":{"observed_at":"2026-08-12T18:52:15.957502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.923613Z","title":"Procedural generalization by planning with self- supervised world models","venue":null,"work_id":"099c822f-ed3a-4e79-ad1e-6025770ee6b3","year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.115843Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7c30066c1e54b9fa54040cb45ce9ca15ec2a5a278e5d0cb95d91d585035a291b","observation_id":"3a789aae-e73c-4d19-9027-2d0f5b2d8d87","resolution":{"observed_at":"2026-08-12T18:52:15.930129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1509.02971","last_updated":"2019-07-05T10:47:27Z","snapshot_observed_at":"2026-07-06T04:29:24.362640Z","submitted_at":"2015-09-09T23:01:36Z","title":"Continuous control with deep reinforcement learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1509.02971","snapshot_observed_at":"2026-08-12T18:52:14.122412Z","title":"Continuous control with deep reinforcement learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.122412Z"},"links":{"cited_paper":"/paper/1509.02971","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:7fd5bbd576186fdd9255f4fccc75710b0523995776fa4f61d0e87c55396bec8a","observation_id":"8191e294-8603-496c-ac80-23d6d02ced71","resolution":{"observed_at":"2026-08-12T18:52:14.122412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.07207","last_updated":"2019-10-18T09:17:44Z","snapshot_observed_at":"2026-08-14T00:35:36.804755Z","submitted_at":"2019-10-16T08:11:08Z","title":"Soft Actor-Critic for Discrete Action Settings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.07207","snapshot_observed_at":"2026-08-12T18:52:14.128108Z","title":"Soft actor-critic for discrete action settings","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.128108Z"},"links":{"cited_paper":"/paper/1910.07207","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:df9f4fb6b811d47dd428f106835268918be62cd8472508c9904479673ddbdce1","observation_id":"67f86b76-e5df-433a-9d5b-4d957e1c4d7f","resolution":{"observed_at":"2026-08-12T18:52:14.128108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.05982","last_updated":"2021-03-18T03:42:07Z","snapshot_observed_at":"2026-08-14T09:15:46.080027Z","submitted_at":"2021-01-15T06:25:58Z","title":"Randomized Ensembled Double Q-Learning: Learning Fast Without a Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.05982","snapshot_observed_at":"2026-08-12T18:52:14.133486Z","title":"Randomized ensembled double q-learning: Learning fast without a model","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.133486Z"},"links":{"cited_paper":"/paper/2101.05982","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:bf36fa430a58104810e841d7490351f5733ae5e1ce49e7c0e6599b9b836d23f3","observation_id":"647d8e40-34e7-426c-9e3a-22a911530c30","resolution":{"observed_at":"2026-08-12T18:52:14.133486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.06865","last_updated":"2019-02-28T18:32:24Z","snapshot_observed_at":"2026-08-14T17:14:38.454793Z","submitted_at":"2019-02-19T02:36:14Z","title":"Hyperbolic Discounting and Learning over Multiple Horizons","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.06865","snapshot_observed_at":"2026-08-12T18:52:14.139308Z","title":"Hyperbolic discounting and learning over multiple horizons","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.139308Z"},"links":{"cited_paper":"/paper/1902.06865","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:a313ead8a6bdd402ea5b5d4cec52b3d6ddec9782e5c78eeb58dc2d5b142d3484","observation_id":"374e405b-4b04-45f4-83fb-862ff989b69c","resolution":{"observed_at":"2026-08-12T18:52:14.139308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:14.145455Z","title":"Distributional reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.145455Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:795e93d9f2f791fe36a9e79022cea1a5d65c3ae99e889461e2e6655ac826393b","observation_id":"7c7d798d-9207-4edd-bbfb-2bf07d77522f","resolution":{"observed_at":"2026-08-12T18:52:14.145455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.871390Z","title":"A distributional perspective on reinforce- ment learning","venue":null,"work_id":"a9531aa4-dc24-4a93-8c1a-ba6b5cda9f50","year":2017},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.152043Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:8f24199d9ac236a19f2afb41025dbf39b6ec452e33d06c50a97d1ba23af1df6d","observation_id":"a80a2690-920f-4dcc-a20e-c6fe2d3e20c5","resolution":{"observed_at":"2026-08-12T18:52:15.880787Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.836068Z","title":"Master- ing atari, go, chess and shogi by planning with a learned model","venue":null,"work_id":"9e73c324-c0c1-4914-808e-d201e5799f1a","year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.157375Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:956d3e50b18ebd7dcf7b3a99ca0332d527bfac11532826557f2a742f95ffa890","observation_id":"b3fb6b71-b9bc-4aab-b734-bc63f7e6d827","resolution":{"observed_at":"2026-08-12T18:52:15.844007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.810223Z","title":"Muesli: Combining improvements in policy optimization","venue":null,"work_id":"f2087ab7-e5ed-4839-aabe-710ec49c3998","year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.163355Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:b0114faecf8dbb0f77f7e19807fb6461308bf80051f2498105294dd4f2bc1d8b","observation_id":"a7361680-cdc3-4cea-bd0c-5acec0d6d4eb","resolution":{"observed_at":"2026-08-12T18:52:15.817027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:14.169131Z","title":"Recurrent experience replay in distributed reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.169131Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:2892492c42e98ccb489a164dad7409010e81c1cacaaa5ff4e0113c51f6c851de","observation_id":"c2e0771e-0d10-4528-8509-f9777f086280","resolution":{"observed_at":"2026-08-12T18:52:14.169131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-12T18:52:14.174551Z","title":"Proximal policy optimization algorithms","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.174551Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:e77234aee7a8b3d6cd33e7459e4dd7e47a54ce27a81abb55b34bf4131ddd5159","observation_id":"40c7ac26-6f61-4c9e-b1b3-44f7f7a374c3","resolution":{"observed_at":"2026-08-12T18:52:14.174551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1806.06920","last_updated":"2018-06-14T12:46:23Z","snapshot_observed_at":"2026-08-14T19:03:44.264477Z","submitted_at":"2018-06-14T12:46:23Z","title":"Maximum a Posteriori Policy Optimisation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1806.06920","snapshot_observed_at":"2026-08-12T18:52:14.180450Z","title":"Maximum a posteriori policy optimisation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.180450Z"},"links":{"cited_paper":"/paper/1806.06920","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:b7900b85b3d2d050b22cf33e0634047233dbc94857b14fa905b63b358faabf82","observation_id":"612ce31d-b75e-4b5e-b4b7-a37ca61c0365","resolution":{"observed_at":"2026-08-12T18:52:14.180450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.00177","last_updated":"2019-10-07T20:23:21Z","snapshot_observed_at":"2026-08-13T13:59:34.315271Z","submitted_at":"2019-10-01T02:23:38Z","title":"Advantage-Weighted Regression: Simple and Scalable Off-Policy Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.00177","snapshot_observed_at":"2026-08-12T18:52:14.186478Z","title":"Advantage-weighted regres- sion: Simple and scalable off-policy reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.186478Z"},"links":{"cited_paper":"/paper/1910.00177","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:402a42abf468529a1c0779c723bd9fba028ec5e98c6334f1b82beb36908a2530","observation_id":"6f3d5b54-4372-4e5f-9c0f-17112c7d1318","resolution":{"observed_at":"2026-08-12T18:52:14.186478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:14.193218Z","title":"Exponentially weighted imitation learning for batched historical data","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.193218Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:471c4baf3e2e0ba72bd064691611cca8272775629e199515873443366bb667ba","observation_id":"59901b18-e97b-4a98-8c72-e88d256edae7","resolution":{"observed_at":"2026-08-12T18:52:14.193218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.758802Z","title":"Bail: Best-action imitation learning for batch deep reinforcement learning","venue":null,"work_id":"7db32c51-d510-4533-9848-f576140a76c6","year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.198312Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:ed21656707731f17df100308fcf1f39992740bfbe48b35cd7ee0432aefed9334","observation_id":"166a53ed-4c82-4faa-8d92-a506cafd2059","resolution":{"observed_at":"2026-08-12T18:52:15.766752Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08396","last_updated":"2020-06-17T10:12:44Z","snapshot_observed_at":"2026-08-11T03:30:21.229658Z","submitted_at":"2020-02-19T19:21:08Z","title":"Keep Doing What Worked: Behavioral Modelling Priors for Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08396","snapshot_observed_at":"2026-08-12T18:52:14.203248Z","title":"Keep doing what worked: Behavioral modelling priors for offline reinforcement learning","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.203248Z"},"links":{"cited_paper":"/paper/2002.08396","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:c1b6f69becb478cdb5afe2fbbc683b0f13e1501e031e667f559302ae99e90e83","observation_id":"86fb7dca-6b1a-40a3-a2b4-e10de2391ae9","resolution":{"observed_at":"2026-08-12T18:52:14.203248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04698","last_updated":"2023-12-09T10:05:10Z","snapshot_observed_at":"2026-08-13T17:55:59.687725Z","submitted_at":"2021-10-10T03:55:17Z","title":"A Closer Look at Advantage-Filtered Behavioral Cloning in High-Noise Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04698","snapshot_observed_at":"2026-08-12T18:52:14.208957Z","title":"A closer look at advantage-filtered behavioral cloning in high- noise datasets","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.208957Z"},"links":{"cited_paper":"/paper/2110.04698","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:9bfcbc30e31ba3b7ed067018904383e188bcc5142dac65fab9bab98889c579b6","observation_id":"7d07980a-ae61-4c9e-a9c3-629792bcc40f","resolution":{"observed_at":"2026-08-12T18:52:14.208957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.731270Z","title":"Overcoming exploration in reinforcement learning with demonstrations","venue":null,"work_id":"09d75c7c-e1d3-41db-a237-855a30ea27a0","year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.214502Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:b09fc77279e834e888b3d4be872918dba1fa21b7a3888f87505fcdf639bc5801","observation_id":"b0968bcb-c780-4cea-8a85-0db55f8dc90c","resolution":{"observed_at":"2026-08-12T18:52:15.738491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.09359","last_updated":"2021-04-24T22:39:30Z","snapshot_observed_at":"2026-07-06T09:29:45.475911Z","submitted_at":"2020-06-16T17:54:41Z","title":"AWAC: Accelerating Online Reinforcement Learning with Offline Datasets","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.09359","snapshot_observed_at":"2026-08-12T18:52:14.220716Z","title":"Awac: Accelerating online reinforcement learning with offline datasets","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.220716Z"},"links":{"cited_paper":"/paper/2006.09359","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:6be34e73909309cdb3d9f2449e9889a946d04cd1f6ee93c063d0c279888326ff","observation_id":"cfaed87a-5deb-42f3-81e0-b1999934b1d8","resolution":{"observed_at":"2026-08-12T18:52:14.220716Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01643","last_updated":"2020-11-01T23:50:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-04T17:00:15Z","title":"Offline Reinforcement Learning: Tutorial, Review, and Perspectives on Open Problems","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.01643","snapshot_observed_at":"2026-08-12T18:52:14.226128Z","title":"Offline reinforcement learning: Tutorial, review, and perspectives on open problems","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.226128Z"},"links":{"cited_paper":"/paper/2005.01643","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:e39ce57842435c4142ea5df84de6e600042ff8f90efde0d7d1540e5a76dfe7f9","observation_id":"9b5c2928-7c13-40ad-bd99-74e1eaadfe28","resolution":{"observed_at":"2026-08-12T18:52:14.226128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.710247Z","title":"Revisiting fundamentals of experience replay","venue":null,"work_id":"013e8549-c8c4-44ed-b5a4-5c87f244d483","year":2020},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.232563Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:b1fd78ebdb376746f51d0945960a88c41b38c51553f72f0895e8ac95086ba0a9","observation_id":"118212b6-04ea-458e-b307-1c7c300ca58c","resolution":{"observed_at":"2026-08-12T18:52:15.716815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.687642Z","title":"Reinforcement learning as one big sequence modeling problem","venue":null,"work_id":"d9d49ac8-9f47-47ee-a907-7ebb21995263","year":2021},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.238835Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:128832ba30dbc7f04ec85ecbd383bb8c5a1d9327d1d864bb785e128440babd6c","observation_id":"c542338d-73c0-42c7-b8ab-5699965990a6","resolution":{"observed_at":"2026-08-12T18:52:15.695060Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.15967","last_updated":"2022-11-28T01:36:49Z","snapshot_observed_at":"2026-08-13T15:32:57.220619Z","submitted_at":"2022-05-31T17:15:44Z","title":"You Can't Count on Luck: Why Decision Transformers and RvS Fail in Stochastic Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.15967","snapshot_observed_at":"2026-08-12T18:52:14.243975Z","title":"You can’t count on luck: Why decision transformers fail in stochastic environments","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.243975Z"},"links":{"cited_paper":"/paper/2205.15967","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:484bbb677fe7ab777dbbc628f1b5e89d085376607613f4c524b5b5a2b96a9479","observation_id":"8862e074-d44a-4521-a4bf-34ddff2549f7","resolution":{"observed_at":"2026-08-12T18:52:14.243975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06402","last_updated":"2024-02-09T13:40:11Z","snapshot_observed_at":"2026-08-14T16:46:44.765468Z","submitted_at":"2024-02-09T13:40:11Z","title":"Hierarchical Transformers are Efficient Meta-Reinforcement Learners","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06402","snapshot_observed_at":"2026-08-12T18:52:14.250302Z","title":"Hierarchical transformers are efficient meta-reinforcement learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.250302Z"},"links":{"cited_paper":"/paper/2402.06402","citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:4ac82cc429a086046c969dbbd98f471a5094557376c98126926eb84fb3245aa6","observation_id":"ea4c9466-2d31-4be8-96e1-dbb92d1eec48","resolution":{"observed_at":"2026-08-12T18:52:14.250302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.665445Z","title":"Learning phrase representations using rnn encoder– decoder for statistical machine translation","venue":null,"work_id":"bedf5325-5d4b-44fb-8218-c55c2af1228f","year":2014},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.256163Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:70e406aae03075f00f39a63c54ea7684111555b4ec72e076bc3055d376641d85","observation_id":"8004eaeb-663d-43da-baee-28a98857afbf","resolution":{"observed_at":"2026-08-12T18:52:15.673193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:15.641679Z","title":"Reinforcement learning with fast and forgetful memory","venue":null,"work_id":"b1f9fda0-951d-491d-8efb-06e2652aa30a","year":2024},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.261608Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:1716799babe1a60fa5c12a90b5ab1aec544c78b232021ed1125585de9d2e3e2a","observation_id":"2213d364-c7d0-4ce6-bd32-3548ea3f78c8","resolution":{"observed_at":"2026-08-12T18:52:15.649192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T18:52:14.267276Z","title":"Rainbow: Combining improvements in deep reinforcement learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T18:52:14.267276Z"},"links":{"citing_paper":"/paper/2411.11188"},"observation_digest":"sha256:797cad4a13ae8f51fb72977148e421e965ede85a619a6bd3e8f3b184e5ab92fa","observation_id":"216c0b54-1e8e-4a13-b209-4a5c246ed9f7","resolution":{"observed_at":"2026-08-12T18:52:14.267276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.11188","last_updated":"2024-11-17T22:25:40Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T09:22:58.956875Z","submitted_at":"2024-11-17T22:25:40Z","title":"AMAGO-2: Breaking the Multi-Task Barrier in Meta-Reinforcement Learning with Transformers"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":2,"verified_fuzzy":21},"total_outbound_references":115},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 100 of 115 outbound references and 0 inbound Pith citation observations for arXiv:2411.11188."}