{"as_of":"2026-08-12T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dbc1730a77d13ebe291e9855ed472b606ab5cf4f21e0238c0563bee36ce7da8f","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T20:41:45.249886Z","state":"measured"},{"denominator":65,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":65,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.10410/citation-record","integrity":"/paper/2412.10410/integrity","json":"/paper/2412.10410/citation-record.json","paper":"/paper/2412.10410"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:44.943729Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.943729Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:c3cffe0a8c7a83cbaaa70a113a2aad8b28cd36765b6ed17359462c5638e73d0c","observation_id":"f50f39f2-e052-4655-b5da-a369fe0d3d19","resolution":{"observed_at":"2026-08-11T20:41:44.943729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.996256Z","title":"Multi-objective latent space optimization of generative molecular design models","venue":null,"work_id":"36b8d7f1-9031-49bc-8380-fadc965af2be","year":2024},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.949822Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:9899d4d863ed7e970d6ce70d41754d2019c03d964005366df8cd348e2fd18008","observation_id":"28369869-51de-4e3f-b658-9b9c64591727","resolution":{"observed_at":"2026-08-11T20:41:46.001240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.05672","last_updated":"2021-01-21T03:25:38Z","snapshot_observed_at":"2026-07-06T10:23:03.672913Z","submitted_at":"2020-12-10T13:55:47Z","title":"Imitating Interactive Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.05672","snapshot_observed_at":"2026-08-11T20:41:44.960832Z","title":"Imitating interactive intelligence","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.960832Z"},"links":{"cited_paper":"/paper/2012.05672","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:0a3b32ac2be816f907d3d090da2086e06d923b25ff5ee88fe79dd3b113413425","observation_id":"14e1e029-8980-4bd3-a986-8f2bf97615fc","resolution":{"observed_at":"2026-08-11T20:41:44.960832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:44.965648Z","title":"An optimistic perspective on offline reinforcement learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.965648Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:09b70f313c7e87f60c3c8da9de3dd70d8425e6cd5680bfe75a9ed43fa580a260","observation_id":"218ff899-930d-4e8f-a422-d73ca4dcb064","resolution":{"observed_at":"2026-08-11T20:41:44.965648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.13611","last_updated":"2021-05-04T19:20:46Z","snapshot_observed_at":"2026-08-06T03:14:46.253254Z","submitted_at":"2020-10-26T14:31:08Z","title":"OPAL: Offline Primitive Discovery for Accelerating Offline Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.13611","snapshot_observed_at":"2026-08-11T20:41:44.970264Z","title":"Opal: Offline primitive discovery for accelerating offline reinforcement learning","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.970264Z"},"links":{"cited_paper":"/paper/2010.13611","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:d11741d1b44c87c8b374f0cb49d92095bd01062814085263ff7382ce6ae27c6c","observation_id":"e7a7730c-45b8-4919-b357-713eb95f3b6b","resolution":{"observed_at":"2026-08-11T20:41:44.970264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.14198","last_updated":"2022-11-15T23:07:37Z","snapshot_observed_at":"2026-07-06T13:05:12.350238Z","submitted_at":"2022-04-29T16:29:01Z","title":"Flamingo: a Visual Language Model for Few-Shot Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.14198","snapshot_observed_at":"2026-08-11T20:41:44.976022Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.976022Z"},"links":{"cited_paper":"/paper/2204.14198","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:c8c609fb90532a9fef4305d8b3d2b4b7fc9f8d08a7cbc209ef894bf2a8fbf8a0","observation_id":"5edea55d-0b14-4aca-a234-78064cce8fe4","resolution":{"observed_at":"2026-08-11T20:41:44.976022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:44.981536Z","title":"Fixing a broken elbo","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.981536Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:0459afd06b3e54805fdf809178251d2fdd13ad2cac3e384480d68dac6e02acb8","observation_id":"8744f31c-5e5a-4fa7-9fa7-7aaeed675001","resolution":{"observed_at":"2026-08-11T20:41:44.981536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.01495","last_updated":"2018-02-23T10:04:20Z","snapshot_observed_at":"2026-08-05T02:06:43.683268Z","submitted_at":"2017-07-05T17:55:53Z","title":"Hindsight Experience Replay","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.01495","snapshot_observed_at":"2026-08-11T20:41:44.985917Z","title":"Abbeel, and Wojciech Zaremba","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.985917Z"},"links":{"cited_paper":"/paper/1707.01495","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:ef875c5caea7187ba76c94030fc3dfdcf9c09f25620eb587d44c738f7b085285","observation_id":"69ca765b-5454-4b5d-9ab9-0dba13e472d5","resolution":{"observed_at":"2026-08-11T20:41:44.985917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.968058Z","title":"Agent57: Outperforming the atari human benchmark","venue":null,"work_id":"15e1eea5-3be1-4d66-b1d8-89ccd12656a1","year":2020},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.990370Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:f6452ebf6d62d72f95984fad1e9c9cd4c6df18882206caa3b13417c6400ddb84","observation_id":"7c984fe0-9b1a-41e1-9940-fc603d54ba1f","resolution":{"observed_at":"2026-08-11T20:41:45.972738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.11795","last_updated":"2022-06-23T16:01:11Z","snapshot_observed_at":"2026-08-12T15:00:45.579292Z","submitted_at":"2022-06-23T16:01:11Z","title":"Video PreTraining (VPT): Learning to Act by Watching Unlabeled Online Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.11795","snapshot_observed_at":"2026-08-11T20:41:44.993876Z","title":"Video pretraining (vpt): Learning to act by watching unlabeled online videos","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.993876Z"},"links":{"cited_paper":"/paper/2206.11795","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:a93562b7871709274577e4e5db21b84e6a38690355ba791e16952031f3cb9780","observation_id":"06676397-6534-4398-8f3b-c47ad9508a58","resolution":{"observed_at":"2026-08-11T20:41:44.993876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:44.999032Z","title":"The arcade learning environment: An evaluation platform for general agents","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:44.999032Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:d01ca828724993eb7c34c9ae11ecbb8a119f4ad98b391ff1d2d1c637f3d08770","observation_id":"500ce3f9-1759-4886-9837-0aaeff9386bb","resolution":{"observed_at":"2026-08-11T20:41:44.999032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-11T20:41:45.003192Z","title":"Joshi, Ryan C","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.003192Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:a628134b86f64113c2088496093ef81881950f0146efe3b4819f17b33637b474","observation_id":"2cf34361-3637-4dd8-8133-e34fa7774007","resolution":{"observed_at":"2026-08-11T20:41:45.003192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-11T20:41:45.013831Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.013831Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:72d27391163676ecee6c3a14151597ab1995fb0a154f7e68cfb3e3604ad8107f","observation_id":"1732c799-21f6-4b38-b370-1f9ef5864090","resolution":{"observed_at":"2026-08-11T20:41:45.013831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T20:41:45.021602Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.021602Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:04829883b5509a1f2cc020ffdd132013cedc84ad5c05a931b20e3cc5ada99bb4","observation_id":"8da9e833-c68d-4395-b509-f4bd10d0700b","resolution":{"observed_at":"2026-08-11T20:41:45.021602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.946009Z","title":"Open-world multi-task control through goal-aware representation learning and adaptive horizon prediction","venue":null,"work_id":"a7c123dc-5922-4762-a9df-22d0664f8a33","year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.026106Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:b0b99384387047c32e4b66054076903f964045bb199e562f651f76e21e2c68b9","observation_id":"70444ac8-ee54-4e16-946a-323d725855cd","resolution":{"observed_at":"2026-08-11T20:41:45.950291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.933670Z","title":"Groot: Learning to follow instructions by watching gameplay videos","venue":null,"work_id":"c1743117-719c-495c-8cfd-f419ecea13e1","year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.030662Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:33753457a51a64b52dbd16b6053f45a33f273790152f0b78c9e0a2573fe30890","observation_id":"f24ea4a2-6aa5-4c12-90fb-e4beb55d40b1","resolution":{"observed_at":"2026-08-11T20:41:45.937746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.919932Z","title":"Abbeel, A","venue":null,"work_id":"d20034b7-1416-4691-ab70-d9aa9cf3a4f0","year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.034180Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:7d7bb2644825c92e6dd01c39691009519a90c100cbe0a42407a5ae3ce837a32d","observation_id":"83b80df0-fc92-467f-b030-94ed50058ad0","resolution":{"observed_at":"2026-08-11T20:41:45.923865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.042834Z","title":"Transformer-xl: Attentive language models beyond a fixed-length context","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.042834Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:5c39e7ef420d94b683263ae6a21e1c0cf30ca9ff6a1454134d9b369351451db8","observation_id":"18ad4ab7-8f55-4320-bc0c-aa46bd7932f0","resolution":{"observed_at":"2026-08-11T20:41:45.042834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-11T20:41:45.046948Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.046948Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:1f6682c715a1bb22e36e4cbbfb8ac623f6903c8d513738ab7e9eadef8dd1ed39","observation_id":"4f7cf927-0b2e-4ad3-abc6-6678d4951c82","resolution":{"observed_at":"2026-08-11T20:41:45.046948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-11T20:41:45.049894Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.049894Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:1499f163ebd855a7e73542fcf02c7671138b7c443f5cbb051d1965ee9f567730","observation_id":"bc4d0dcc-4b45-404c-bb45-3bccd86d4211","resolution":{"observed_at":"2026-08-11T20:41:45.049894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.906864Z","title":"One-shot imitation learning","venue":null,"work_id":"f5a0e96b-540b-461f-95d9-bcc9d6dde6f7","year":2017},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.053932Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:2f073bd3546072d84a81903dd93c96d29f2bfffc866187677a87c756cf95ed21","observation_id":"2c6542bb-2217-4c5d-8b02-0beca396f1c0","resolution":{"observed_at":"2026-08-11T20:41:45.911107Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.11527","last_updated":"2019-11-27T19:53:57Z","snapshot_observed_at":"2026-08-12T22:44:48.344637Z","submitted_at":"2019-08-30T04:12:08Z","title":"Implicit Deep Latent Variable Models for Text Generation","version":3},"cited_work":{"arxiv_id":"1908.11527","doi":null,"metadata_source":"pith","pith_arxiv_id":"1908.11527","snapshot_observed_at":"2026-08-11T20:41:45.522500Z","title":"Implicit Deep Latent Variable Models for Text Generation","venue":"cs.LG","work_id":"f267d113-abc1-4a0f-a885-ed4e81627a47","year":2019},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.057282Z"},"links":{"cited_paper":"/paper/1908.11527","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:c40f831fb3d318294a64377c1647da988e889117bac9a112a0e159fa9fd1c6a8","observation_id":"d26f0261-4177-45a8-8f12-8f61498869d1","resolution":{"observed_at":"2026-08-11T20:41:45.530666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.11956","last_updated":"2019-10-25T23:01:43Z","snapshot_observed_at":"2026-08-10T09:36:39.578860Z","submitted_at":"2019-10-25T23:01:43Z","title":"Relay Policy Learning: Solving Long-Horizon Tasks via Imitation and Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.11956","snapshot_observed_at":"2026-08-11T20:41:45.061059Z","title":"Relay policy learning: Solving long-horizon tasks via imitation and reinforcement learning","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.061059Z"},"links":{"cited_paper":"/paper/1910.11956","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:b57662fb6cef7531a0eca37a665dad4e084a29b8e23a7d7afe81f6b72f5a2373","observation_id":"293ec0b5-6d0c-43aa-8f62-93c0d783b7d5","resolution":{"observed_at":"2026-08-11T20:41:45.061059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.064991Z","title":"Guss, Brandon Houghton, Nicholay Topin, Phillip Wang, Cayden Codel, Manuela M","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.064991Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:7f718da84cd2109d0ae86da638146e19054cef843020e999dae456b98028e0df","observation_id":"13f6abe7-be3c-4463-8429-2a2b75e76ab5","resolution":{"observed_at":"2026-08-11T20:41:45.064991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.887693Z","title":"Vln-bert: A recurrent vision-and-language bert for navigation","venue":null,"work_id":"c175772f-6168-4676-8f5d-e2665eea92d7","year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.068745Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:9303926ba5ee3ca5c6e0fe2428769aac7e6059bc78725a8ef4e364aab17b06c1","observation_id":"02419236-e53b-41a7-8067-4f6d8b769539","resolution":{"observed_at":"2026-08-11T20:41:45.891844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-05T10:01:43.401012Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12871","snapshot_observed_at":"2026-08-11T20:41:45.074200Z","title":"An embodied generalist agent in 3d world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.074200Z"},"links":{"cited_paper":"/paper/2311.12871","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:5e343348c7fba468358401405e94b132ad58a2802344ac71df1eeaebac8eae4a","observation_id":"14dc7441-235e-4a76-a095-56bdd444ded0","resolution":{"observed_at":"2026-08-11T20:41:45.074200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12943","last_updated":"2024-08-27T23:15:11Z","snapshot_observed_at":"2026-07-06T17:47:13.814205Z","submitted_at":"2024-03-19T17:47:37Z","title":"Vid2Robot: End-to-end Video-conditioned Policy Learning with Cross-Attention Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12943","snapshot_observed_at":"2026-08-11T20:41:45.078763Z","title":"Vid2robot: End-to-end video-conditioned policy learning with cross-attention transformers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.078763Z"},"links":{"cited_paper":"/paper/2403.12943","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:27d84eb6dea743da16c67643c7ddd943838be55acefc8c51918bc804d7029950","observation_id":"5fafca65-a57c-47b7-ab54-a0b2091c12a5","resolution":{"observed_at":"2026-08-11T20:41:45.078763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.02005","last_updated":"2022-02-04T07:30:48Z","snapshot_observed_at":"2026-08-05T03:13:24.650146Z","submitted_at":"2022-02-04T07:30:48Z","title":"BC-Z: Zero-Shot Task Generalization with Robotic Imitation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.02005","snapshot_observed_at":"2026-08-11T20:41:45.083397Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.083397Z"},"links":{"cited_paper":"/paper/2202.02005","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:97d362c01112ac3730aa18a7816c540f64428ba9fd5f209dd71807a447f189a4","observation_id":"61b1740d-0afc-4bfd-9177-f8d85f0c2d28","resolution":{"observed_at":"2026-08-11T20:41:45.083397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.873768Z","title":"The malmo platform for artificial intelligence experimentation","venue":null,"work_id":"b7c2e6b8-f8a1-4d68-9eae-735ac331cb6d","year":2016},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.088113Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:1d995e90f0c8c669d98b609ce349c5658435c631096e5368456a2777e4d4a1a3","observation_id":"0352c213-bfdc-4930-bc33-46e87ae24b0f","resolution":{"observed_at":"2026-08-11T20:41:45.878744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-11T20:41:45.092438Z","title":"Kingma and Max Welling","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.092438Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:5e0179dba6408451d2daf3dcdacd9b2daffd3ffe84badfc90a085090d76ca7b6","observation_id":"1b0a3218-9245-42d3-960d-a904105392fc","resolution":{"observed_at":"2026-08-11T20:41:45.092438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.096021Z","title":"Multi-game decision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.096021Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:46e5a464171ccd7f48c967118541a451383794a7c76ccaaa91aa6ea0fa85407f","observation_id":"3f602080-664e-463e-a314-8bd7086f9af2","resolution":{"observed_at":"2026-08-11T20:41:45.096021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05941","last_updated":"2024-05-09T17:30:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-09T17:30:16Z","title":"Evaluating Real-World Robot Manipulation Policies in Simulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05941","snapshot_observed_at":"2026-08-11T20:41:45.100715Z","title":"Evaluating real-world robot manipulation policies in simulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.100715Z"},"links":{"cited_paper":"/paper/2405.05941","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:d8f10d279d155983797d60af83b4ba284f6905009bef6adac4c727678e78292d","observation_id":"3daa7d74-c326-499c-82d9-52b066f61ea0","resolution":{"observed_at":"2026-08-11T20:41:45.100715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00937","last_updated":"2024-02-04T04:57:08Z","snapshot_observed_at":"2026-08-12T09:34:48.580055Z","submitted_at":"2023-06-01T17:39:41Z","title":"STEVE-1: A Generative Model for Text-to-Behavior in Minecraft","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00937","snapshot_observed_at":"2026-08-11T20:41:45.105155Z","title":"McIlraith","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.105155Z"},"links":{"cited_paper":"/paper/2306.00937","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:9565ef62dd3fc41b6dac0e90bc5ceb60420904630c48536286a087375b080302","observation_id":"158adb09-896f-45fb-9640-3dd60c27624c","resolution":{"observed_at":"2026-08-11T20:41:45.105155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17172","last_updated":"2023-12-28T17:57:06Z","snapshot_observed_at":"2026-08-01T22:57:31.468506Z","submitted_at":"2023-12-28T17:57:06Z","title":"Unified-IO 2: Scaling Autoregressive Multimodal Models with Vision, Language, Audio, and Action","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17172","snapshot_observed_at":"2026-08-11T20:41:45.116529Z","title":"Unified-io 2: Scaling autoregressive multimodal models with vision, language, audio, and action","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.116529Z"},"links":{"cited_paper":"/paper/2312.17172","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:01050ba303e289047a6dc66c2c5e2531db3354142635447046390e983871ea42","observation_id":"4bb96c3a-44ef-4fd2-8a33-8135c6256bc9","resolution":{"observed_at":"2026-08-11T20:41:45.116529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07648","last_updated":"2021-07-07T23:43:24Z","snapshot_observed_at":"2026-08-12T05:41:19.982086Z","submitted_at":"2020-05-15T17:08:50Z","title":"Language Conditioned Imitation Learning over Unstructured Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07648","snapshot_observed_at":"2026-08-11T20:41:45.120926Z","title":"Language conditioned imitation learning over unstructured data","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.120926Z"},"links":{"cited_paper":"/paper/2005.07648","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:bdf5ca3eb5d892397558fa9ab20bb972bb2aa2729afc3a560dfed325c997764b","observation_id":"151077ff-6bb6-4603-adb4-be779ff5523e","resolution":{"observed_at":"2026-08-11T20:41:45.120926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.850750Z","title":"Learning latent plans from play","venue":null,"work_id":"6b9cfcab-440b-4604-8f15-a7a5caf8bc34","year":2020},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.124914Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:26217affc0acd433ff00d741a0d3a54e3cf9b20b9f4a85e16d6d5333ac2d2e73","observation_id":"8b7ab2c4-e7d8-40eb-acd9-3de1f078aaf5","resolution":{"observed_at":"2026-08-11T20:41:45.854733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.837297Z","title":"Learning latent plans from play","venue":null,"work_id":"a6927b8e-9fbf-43e0-931e-8a0c3862a1fc","year":2020},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.128533Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:41dc22f4fa04807d6c02c1e1edc59d2d41a8d037fcdb9da765828127f346b0dd","observation_id":"8f0b4f59-1616-491c-9527-c1e1dc268d6d","resolution":{"observed_at":"2026-08-11T20:41:45.841767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.823349Z","title":"Learning latent plans from play","venue":null,"work_id":"cd98fa58-4b35-4462-9c05-8cbd46dd16e7","year":2020},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.132613Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:5166ea9e6e7b1a839db1e03dd74315dfbb59c517a0a79bd6a3150df424fa4508","observation_id":"85dae5c4-4642-4d51-9bf8-e5e2390ec52a","resolution":{"observed_at":"2026-08-11T20:41:45.827698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.136889Z","title":"Interactive language: Talking to robots in real time","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.136889Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:59958e75030b051e2fbcd16a3ba529c6716b1954c2b7226dc7b319f0e2df1ce6","observation_id":"53c39c27-ffb2-4a5c-a38b-200f01ec7b37","resolution":{"observed_at":"2026-08-11T20:41:45.136889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.12403","last_updated":"2023-10-13T03:48:11Z","snapshot_observed_at":"2026-07-06T13:24:24.494561Z","submitted_at":"2022-06-24T17:59:02Z","title":"ZSON: Zero-Shot Object-Goal Navigation using Multimodal Goal Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.12403","snapshot_observed_at":"2026-08-11T20:41:45.140755Z","title":"Zson: Zero-shot object-goal navigation using multimodal goal embeddings","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.140755Z"},"links":{"cited_paper":"/paper/2206.12403","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:13e2e57e887f562d394afaaa55ad380a1cb69bc909c1a452d31a66baef51b690","observation_id":"1c85f61f-d6cc-400c-9029-c29b0d88694e","resolution":{"observed_at":"2026-08-11T20:41:45.140755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.802323Z","title":"What matters in language conditioned robotic imitation learning over unstructured data","venue":null,"work_id":"ab9282f6-62d7-4956-b95e-bc2fc9120c55","year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.145567Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:2b71efe7ab38575e8ec506857801eaa0bb6da2b9e29d83faa36015d6da038481","observation_id":"ee0692f7-bc58-4de7-9fd4-0870847b5b14","resolution":{"observed_at":"2026-08-11T20:41:45.807648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.149036Z","title":"Rusu, Joel Veness, Marc G","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.149036Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:b063f8f5e18a5371a4a9eb911cba850f55edb211c79accbaa51b964a31ed8a70","observation_id":"f5b071b7-f4f6-432b-978a-2fe318553e90","resolution":{"observed_at":"2026-08-11T20:41:45.149036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.783158Z","title":"Goal representations for instruction following: A semi-supervised language interface to control","venue":null,"work_id":"50245fb4-bc0f-4874-955b-e8c92ba87771","year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.152603Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:dc4c08226faad1508f161014c17e9277cfa13bbe43111c12e18f27a312f82f0b","observation_id":"58d8e0f2-56fc-4a86-b104-0c53e31d9b77","resolution":{"observed_at":"2026-08-11T20:41:45.787144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.156190Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.156190Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:2d13b177547b3182c671e1849c8ab5cdf8a0c4f6e0b22f9088e57f1b4dd5beaf","observation_id":"f89879f9-987a-4a0c-99f1-cc009537a33d","resolution":{"observed_at":"2026-08-11T20:41:45.156190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-11T05:34:32.208314Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-11T20:41:45.159279Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.159279Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:f002848778f1cc2ec12d45012075381235d7feabc26372c36392ac7a8e29d28f","observation_id":"152c4e05-a8ed-4815-983d-9f22f37cce05","resolution":{"observed_at":"2026-08-11T20:41:45.159279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1812.04405","last_updated":"2018-12-11T14:05:24Z","snapshot_observed_at":"2026-08-06T03:03:40.023757Z","submitted_at":"2018-12-11T14:05:24Z","title":"Conditional Variational Autoencoder for Neural Machine Translation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1812.04405","snapshot_observed_at":"2026-08-11T20:41:45.162510Z","title":"Conditional variational autoencoder for neural machine translation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.162510Z"},"links":{"cited_paper":"/paper/1812.04405","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:2524956716ba498751c2d5f25a54f0f9ecc8a8245e42074aad07f410ad294462","observation_id":"0bb8bfe7-c9e8-4958-aef8-a31f933bc552","resolution":{"observed_at":"2026-08-11T20:41:45.162510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.761330Z","title":"Episodic transformer for vision-and-language navigation","venue":null,"work_id":"066bc886-b41d-40dc-a1b1-471eb109175b","year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.166517Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:3dd1696487353bd888f453fe449e37d891af26b162cf72cf3e5a2ba832e309f5","observation_id":"84e935d3-5426-47a3-b218-c758916988de","resolution":{"observed_at":"2026-08-11T20:41:45.766547Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.744635Z","title":"Accelerating reinforcement learning with learned skill priors","venue":null,"work_id":"6e0cacc2-2c10-4202-a75b-1cfce1520b79","year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.169963Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:db19c785353a93452a6ee7479280b36038f850ede6077e12e235fe2baf32bbae","observation_id":"87dd3bdf-20cf-41ee-badf-f7e0df4ffe25","resolution":{"observed_at":"2026-08-11T20:41:45.749383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10179","last_updated":"2024-10-11T16:30:24Z","snapshot_observed_at":"2026-08-12T12:27:19.697497Z","submitted_at":"2024-03-13T17:50:32Z","title":"Scaling Instructable Agents Across Many Simulated Worlds","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10179","snapshot_observed_at":"2026-08-11T20:41:45.173544Z","title":"Scaling instructable agents across many simulated worlds","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.173544Z"},"links":{"cited_paper":"/paper/2404.10179","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:54713195851c16c766fd35927672bc6353b3453aa9f84b6fe88a895a5ebb3720","observation_id":"b0412b2c-a674-4c5b-812e-05dd181154cb","resolution":{"observed_at":"2026-08-11T20:41:45.173544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.177377Z","title":"Improving language understanding by generative pre-training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.177377Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:8075b5933fe3c47d0855279e05e6086afeaeb150cb4a3005c59ea3eacff7555e","observation_id":"ea1ff3cd-f5d9-45a3-b93d-d96a13eb9d6c","resolution":{"observed_at":"2026-08-11T20:41:45.177377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.181411Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.181411Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:77b0ce6ae5c10329add5f8d48a821d3a767dbf9ef287c5cbceacbf3ce566ecce","observation_id":"35cf3de0-21f3-4e86-848e-2cd6bc0f9f24","resolution":{"observed_at":"2026-08-11T20:41:45.181411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.186191Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.186191Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:cdfbe9c211ddcd58b3b6583293150bfcd7d17c52f9ffacf25a96fa9c781570e2","observation_id":"4c021881-6925-4123-a7b0-f3c5c08f3fee","resolution":{"observed_at":"2026-08-11T20:41:45.186191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-08T03:18:33.595658Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.06175","snapshot_observed_at":"2026-08-11T20:41:45.191304Z","title":"A generalist agent","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.191304Z"},"links":{"cited_paper":"/paper/2205.06175","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:de90454cb9ffe65910a3e5368f48c4a40d19444cd91d07b78311f354b63d0830","observation_id":"407263d1-4278-4042-b2b2-63265791bec9","resolution":{"observed_at":"2026-08-11T20:41:45.191304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.195401Z","title":"Habitat: A platform for embodied ai research","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.195401Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:713ca3d1722103d112ccd95463caeef67af6667b8fdfc37740cea40a58d8d529","observation_id":"e417dc5c-f1c3-4089-a3b8-ec46ce4657ab","resolution":{"observed_at":"2026-08-11T20:41:45.195401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1912.02875","last_updated":"2020-06-23T15:55:05Z","snapshot_observed_at":"2026-08-11T18:35:25.012343Z","submitted_at":"2019-12-05T21:10:08Z","title":"Reinforcement Learning Upside Down: Don't Predict Rewards -- Just Map Them to Actions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.02875","snapshot_observed_at":"2026-08-11T20:41:45.198736Z","title":"Reinforcement learning upside down: Don't predict rewards - just map them to actions","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.198736Z"},"links":{"cited_paper":"/paper/1912.02875","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:75e42498359e4b84f6950c12ae671410853cac576e9c92789fdbb0577394538f","observation_id":"c31d09c1-597f-45b4-a07a-4debc3ede1aa","resolution":{"observed_at":"2026-08-11T20:41:45.198736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-11T20:41:45.203599Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.203599Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:06b0706976dcb73778979ea29bc20256e9d9973b1c681ee3fb63075716a0f1e8","observation_id":"f5f0f9ab-0452-4a05-859e-96f9a2094da0","resolution":{"observed_at":"2026-08-11T20:41:45.203599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.702610Z","title":"Describe, explain, plan and select: interactive planning with llms enables open-world multi-task agents","venue":null,"work_id":"b1e4b3b1-3e9b-495e-b370-139f5a778e61","year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.213308Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:f47612804315505fbf3eb1c77350a84a22b5edd464e02aaebc5ab864dd637eb3","observation_id":"3b518a75-3d8d-4552-bceb-8f71998c5f2b","resolution":{"observed_at":"2026-08-11T20:41:45.706557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05997","last_updated":"2023-11-30T07:39:48Z","snapshot_observed_at":"2026-08-10T13:34:20.187520Z","submitted_at":"2023-11-10T11:17:58Z","title":"JARVIS-1: Open-World Multi-task Agents with Memory-Augmented Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05997","snapshot_observed_at":"2026-08-11T20:41:45.217706Z","title":"Jarvis-1: Open-world multi-task agents with memory-augmented multimodal language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.217706Z"},"links":{"cited_paper":"/paper/2311.05997","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:ca823ff70766ab3415d6a25957117de5355d8d58dfb786aafc1215b34708fd3f","observation_id":"e80437eb-59ba-462c-83a0-4a437aeed3ba","resolution":{"observed_at":"2026-08-11T20:41:45.217706Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.691450Z","title":"Xskill: Cross embodiment skill discovery","venue":null,"work_id":"a234c14c-a040-445d-a0e4-5645e7beed0c","year":2023},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.223484Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:fe0f5f66945cdda0818ded25db5e9640c7a39dc4ed217a7f70b050d0bfcbc02f","observation_id":"3b12a3f0-374d-4c8a-91ef-fbd89547d5b3","resolution":{"observed_at":"2026-08-11T20:41:45.695643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10897","last_updated":"2021-06-14T18:45:16Z","snapshot_observed_at":"2026-07-06T08:31:50.962710Z","submitted_at":"2019-10-24T03:19:46Z","title":"Meta-World: A Benchmark and Evaluation for Multi-Task and Meta Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10897","snapshot_observed_at":"2026-08-11T20:41:45.228028Z","title":"Julian, Karol Hausman, Chelsea Finn, and Sergey Levine","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.228028Z"},"links":{"cited_paper":"/paper/1910.10897","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:943440e572454c87a4c194d9de85e3c29588db2489808b15cd1708f403f316b0","observation_id":"cdb9dadc-fcbe-496d-b6d0-89fe6d0c414c","resolution":{"observed_at":"2026-08-11T20:41:45.228028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.681554Z","title":"Learning to drive by watching youtube videos: Action-conditioned contrastive policy pretraining","venue":null,"work_id":"b350a4d6-cc4c-4300-88c6-f787eb7b8e45","year":2022},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.232668Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:59ddc109a93181f7190aa6160a3afab2cb88ebea28e7004a55999d11acf1277a","observation_id":"a5e56cbd-a5b0-421b-bd47-db18e53ca0e6","resolution":{"observed_at":"2026-08-11T20:41:45.685235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.03427","last_updated":"2021-06-07T08:48:44Z","snapshot_observed_at":"2026-08-05T21:12:14.091918Z","submitted_at":"2021-06-07T08:48:44Z","title":"Hierarchical Task Learning from Language Instructions with Unified Transformers and Self-Monitoring","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.03427","snapshot_observed_at":"2026-08-11T20:41:45.236842Z","title":"Hierarchical task learning from language instructions with unified transformers and self-monitoring","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.236842Z"},"links":{"cited_paper":"/paper/2106.03427","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:4d9c1cf297eff4196c4f7f3b9ebc199d8ece972135a05fee5c9e30eaeefc1fa2","observation_id":"6a3966b8-a3b1-4ae6-b34e-daebfa857382","resolution":{"observed_at":"2026-08-11T20:41:45.236842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.240583Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.240583Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:0fa84dce362a9bd46a8c68c08d82ef7341a0fbf71ffc714f29a424dd3d3dfd6a","observation_id":"09bb8d68-c8de-434a-bcf7-6a0cf4209639","resolution":{"observed_at":"2026-08-11T20:41:45.240583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T20:41:45.245534Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.245534Z"},"links":{"citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:0c920064eea7c610ae50c5156e322a582f8a47555e56838058c3a4149f39ec9c","observation_id":"83a22687-78ff-4f75-b957-fa99edf90c46","resolution":{"observed_at":"2026-08-11T20:41:45.245534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08367","last_updated":"2025-06-03T02:30:05Z","snapshot_observed_at":"2026-08-09T00:13:59.399628Z","submitted_at":"2023-10-12T14:38:25Z","title":"MCU: An Evaluation Framework for Open-Ended Game Agents","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08367","snapshot_observed_at":"2026-08-11T20:41:45.249886Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-11T20:41:45.249886Z"},"links":{"cited_paper":"/paper/2310.08367","citing_paper":"/paper/2412.10410"},"observation_digest":"sha256:e42cafebcbc4cdde97700deeb065a0f193f5448bd7d699d1ed1290170fc9a741","observation_id":"6b90dc01-faa4-4423-835c-a6af1e088068","resolution":{"observed_at":"2026-08-11T20:41:45.249886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.10410","last_updated":"2024-12-07T05:47:49Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-12T09:35:30.737783Z","submitted_at":"2024-12-07T05:47:49Z","title":"GROOT-2: Weakly Supervised Multi-Modal Instruction Following Agents"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":46,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 0 inbound Pith citation observations for arXiv:2412.10410."}