{"as_of":"2026-08-02T16:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a0279aaedd18e4c74b6bc56eb13ae66a03ecbeac06f3981378ff543c34bbcfd2","coverage":[{"denominator":169,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T19:16:57.396710Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-02T06:30:47.504484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04426/citation-record","integrity":"/paper/2607.04426/integrity","json":"/paper/2607.04426/citation-record.json","paper":"/paper/2607.04426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"A survey of embodied ai: From simulators to research tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:415b3a40e69062e825dcd0769c9e247be135627c57d50825c658ed9e0b62e66a","observation_id":"141927ee-73c4-4369-bbef-f41d36144431","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02385","last_updated":"2024-02-04T07:55:01Z","snapshot_observed_at":"2026-07-06T17:25:01.583656Z","submitted_at":"2024-02-04T07:55:01Z","title":"A Survey on Robotics with Foundation Models: toward Embodied AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02385","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"A survey on robotics with foundation models: Toward embodied ai","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2402.02385","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f9df291f25ef3c14f92546998431dc3a79034ebfc155c8dcdd426c9fdaa00bde","observation_id":"9c1edee8-2682-463f-a42f-df7bb3e171f7","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:3b191e025229005ff9f4871922373b8ba71982ec55cfaeecc92a1475c5850fc6","observation_id":"60a72b50-6c7b-4375-a943-681ffe53f303","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:ea167568d435b88b9c33474e6ba7e61b126677c8d5cd2730ac241a31e471cf3c","observation_id":"58165d18-7887-405b-baa3-2afbd455deb6","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:49a486893de8ea04aa1f87de8db353a4e3bb583940da60ebb70ce0df07f96eeb","observation_id":"28cf012f-3d06-4319-b46c-5ef29d0e95ec","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:eb25813d07ef42a600d9c04ee8ea9ec004c4c2b48d8991c3fa26febf8aefac5d","observation_id":"5533c13a-09e7-414d-89d0-1ff840ab15ab","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:c43f518906b5de43942984ab53276bab7567d0173d9ee715034d3e1884937b6f","observation_id":"2ef9bf37-7c1e-41a8-bc78-7a46816425ac","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.18112","last_updated":"2026-06-29T05:42:10Z","snapshot_observed_at":"2026-07-06T23:53:36.096914Z","submitted_at":"2026-06-16T16:17:44Z","title":"Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.18112","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Qwen-robotnav technical report: A scalable navigation model designed for an agentic navigation system","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2606.18112","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:3c63d66565740461b35618caa8f059ccb90b96d3c45160925914c7f27c7b7e82","observation_id":"bda8b1a1-daa3-4a73-9f9d-525f9dd8159b","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Embodied navigation foundation model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:92fc6c08da3c583357a86f30d0ebb5869fb423ac7b762575b689636023ff68a9","observation_id":"6ba5691b-b952-4833-bc33-a6304beed28a","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"π0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:19b16cb617c0a2743449f1b13d3eabafff3d9d620e10b526fa6bae5e4540379d","observation_id":"53966804-dddf-43d0-bed7-fdefd305dd56","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"World action models are zero-shot policies","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0540dfa7d6b9a153a93d62cc02273aaef0fc0162bb1009ee86407a5d47326d01","observation_id":"a9fa1942-49dc-429a-bcd5-2b4629eb556d","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RoboReward: General-purpose vision-language reward models for robotics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:70d7307f9a6960de948b1594b16a58729bc209cb35c9a670614912e11eed4846","observation_id":"1c4aa590-11c8-4afe-b1f8-4c74f3172d39","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.02115","last_updated":"2026-05-13T21:07:49Z","snapshot_observed_at":"2026-08-01T20:59:07.888539Z","submitted_at":"2026-03-02T17:38:58Z","title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.02115","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RoboMeter: Scaling general-purpose robotic reward models via trajectory comparisons","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2603.02115","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:933222f886dd97c4900097552fa8b91864ec31f436a1ec75cc2572c111632259","observation_id":"59ebd359-cb5b-44bd-a2ae-eacdf6469054","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":null,"venue":null,"work_id":null,"year":1984},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:09295dcf8ec564ef70f78ae6376a605cbd2870e49148e3c5e266e48c473485a6","observation_id":"bd073da7-9d4e-4522-bdcb-dcf59df884ce","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":null,"venue":null,"work_id":null,"year":1986},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:1697cc45124f0d7a41d755e5bb91c7163d0b67d5e3ef5abdb7e0fd3f75d07bdc","observation_id":"504a61aa-e041-4261-bd8e-a3b130c7d4ec","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:6016da56685b2cf7cf493230fbcc1dbed5348750ee77bfdf8b130559e8eadf84","observation_id":"4059a9bd-021a-41ec-b698-9c681b8e03ad","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"π0.5: A vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:3ddcf8666486498a094c0f1cacfbff285a517b3212b6803ee7f765d7a4f49487","observation_id":"a11f0199-c5a2-48cd-8264-5b744e947274","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Interleave-vla: Enhancing robot manipulation with interleaved image-text instructions, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:fdffa7e6bfd73d7a7db18204a7b1de8fcc67ca51821e8a0ff250de3a4838b627","observation_id":"d8024768-a443-4f5e-8af0-e68f88e5c6cd","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Do as i can, not as i say: Grounding language in robotic affordances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:8646b1f9b499d1f85fd75c612d49f744adf0f777f4d27a92e5132be138031e19","observation_id":"9b4a8d58-da77-4c2d-9b77-64e09f539bfa","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"PaLM-E: An embodied multimodal language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:79ac9810114e48bb2efd64aa445a3c4ba63c2074bee0ca9c1c00d7667580bd83","observation_id":"f70ceaa5-d7ca-4acb-8659-72802253413f","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:e4d5a226b1a3a4dd073a59b28a9df74d190c5b1f3bb84d96ad2db61bce6bc88a","observation_id":"b058d83b-7b2b-4987-b783-11ed6293f832","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Voxposer: Composable 3d value maps for robotic manipulation with language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f168c61f99aa15c6013755e992948e882e517c8bb17e8ddf01d32784fffe0e69","observation_id":"648bb15a-ea49-4431-8936-94d9c26d43f5","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RoboCodeX: Multimodal code generation for robotic behavior synthesis","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:930e620a1d32dd064b2ec96106b1f2d5f10552adca34c18718ba84afc67b58f4","observation_id":"2cc9a582-2bab-45f3-9454-e90d5452ef79","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07774","last_updated":"2026-04-09T04:01:27Z","snapshot_observed_at":"2026-07-06T22:57:00.904627Z","submitted_at":"2026-04-09T04:01:27Z","title":"RoboAgent: Chaining Basic Capabilities for Embodied Task Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07774","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RoboAgent: Chaining basic capabilities for embodied task planning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2604.07774","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b63ea267570b72092e01883b111765dded509932b84fb866a31db03250f852d0","observation_id":"5e62c089-d830-47c1-8049-ff8edd7b22ab","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a70f6976c4231148940e2b4a63b43ffd1ad010eb93740bb78b7ede2f4354819c","observation_id":"4a918928-a2f2-482a-b288-595ea9092593","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gr00t n1.5: An improved open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:8384379138e798ff33b848747ec00e0db893a3cf61680d692b98f84c1d595a57","observation_id":"ada86e16-2b55-4088-a0a5-0fe7598a8668","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.30280","last_updated":"2026-06-01T13:48:35Z","snapshot_observed_at":"2026-08-02T05:26:29.614864Z","submitted_at":"2026-05-28T17:36:31Z","title":"Qwen-VLA: Unifying Vision-Language-Action Modeling across Tasks, Environments, and Robot Embodiments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.30280","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Qwen-vla: Unifying vision-language-action modeling across tasks, environments, and robot embodiments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2605.30280","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:6e28934ad9df468b657888502d58a93ef9758e97b4b66feef37d4d4d938a4324","observation_id":"9766699a-0bce-4b34-b608-09ec4ea3ec5a","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17030","last_updated":"2026-06-17T13:54:57Z","snapshot_observed_at":"2026-08-01T21:48:31.832288Z","submitted_at":"2026-06-15T17:52:31Z","title":"Qwen-RobotWorld Technical Report: Unifying Embodied World Modeling through Language-Conditioned Video Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17030","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Qwen-robotworld technical report: Unifying embodied world modeling through language- conditioned video generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2606.17030","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b4f2afa8043af301ee90d8023cd0f93293c1a9e2bd32b7a3c511d2f69f3e310a","observation_id":"d342d7b5-fe9e-46dd-997f-5ec135fef29f","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11236","last_updated":"2026-04-14T10:01:08Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-02-11T16:47:01Z","title":"ABot-M0: VLA Foundation Model for Robotic Manipulation with Action Manifold Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.11236","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Abot-m0: Vla foundation model for robotic manipulation with action manifold learning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2602.11236","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:580b7a00f0567f20d6feda88a2d27ffcc36aa85eca9e5eac956bd7cc41e99be2","observation_id":"56ec2478-6d79-44df-9007-85ba28ba5160","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Rynnbrain: Open embodied foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0623160a2eda87ef807764ae29453aa768c672cd678d3756c0153b1eb84a3e29","observation_id":"8bb52d65-6ea9-4646-81c9-beee96f73e00","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.02800","last_updated":"2026-06-23T17:33:32Z","snapshot_observed_at":"2026-07-06T23:43:07.940839Z","submitted_at":"2026-06-01T19:12:30Z","title":"Cosmos 3: Omnimodal World Models for Physical AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.02800","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Cosmos 3: Omnimodal world models for physical ai","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2606.02800","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:2754d38d3d9aa08e9ea6dcfe5c56a72c02005000ada86f7afcd81164fd55209e","observation_id":"2e3ebbcd-57e3-4dbe-8636-e49b96634871","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Ace-brain-0: Spatial intelligence as a shared scaffold for universal embodiments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:4ac5df5271d9c2d12022dce503df327c32d6408575c6d3987c8ef040a6e61441","observation_id":"ff92efcc-6e25-4e7c-a4aa-2ecb99a70e42","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15153","last_updated":"2026-05-21T16:50:35Z","snapshot_observed_at":"2026-08-01T04:46:15.556475Z","submitted_at":"2026-05-14T17:50:42Z","title":"Pelican-Unify 1.0: A Unified Embodied Intelligence Model for Understanding, Reasoning, Imagination and Action","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15153","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Pelican-unify 1.0: A unified embodied intelligence model for understanding, reasoning, imagination and action","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2605.15153","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b20001cc7dc8e5b8099c270136e82c38d58b04d259d5db2acc5bd45f64e8c341","observation_id":"d107ad8e-e58f-4504-99cf-7b901ab047d2","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.07430","last_updated":"2026-04-08T17:59:48Z","snapshot_observed_at":"2026-07-06T22:55:41.978450Z","submitted_at":"2026-04-08T17:59:48Z","title":"HY-Embodied-0.5: Embodied Foundation Models for Real-World Agents","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.07430","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Hy-embodied-0.5: Embodied foundation models for real-world agents","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2604.07430","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:150950c60557a38f186c0dce664073331a7a0318639abfa71b95c3425a21a0a1","observation_id":"52869e84-c7ed-44fc-8db0-d9ee91b7629b","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15483","last_updated":"2026-04-24T23:18:28Z","snapshot_observed_at":"2026-07-06T23:03:02.938732Z","submitted_at":"2026-04-16T19:18:07Z","title":"${\\pi}_{0.7}$: a Steerable Generalist Robotic Foundation Model with Emergent Capabilities","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15483","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2604.15483","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:d3193646b9debaa0d36680601c39c8502e7a1b7cb77cec8050140275913b6208","observation_id":"77f5b74a-e87a-4d66-98ab-3129af903266","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.14759","last_updated":"2025-11-19T04:34:49Z","snapshot_observed_at":"2026-07-06T22:36:13.287872Z","submitted_at":"2025-11-18T18:58:55Z","title":"$\\pi^{*}_{0.6}$: a VLA That Learns From Experience","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.14759","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"π∗ 0.6: a vla that learns from experience","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2511.14759","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:1b55c0162ec6fa14e53e33e409c58196f65f59e07b9e2a750178269a1db63e41","observation_id":"ceda9816-273d-4627-b6d5-b6722cf28e35","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.11324","last_updated":"2026-07-11T14:44:40Z","snapshot_observed_at":"2026-07-16T23:17:53.174457Z","submitted_at":"2026-06-09T18:07:50Z","title":"Embodied-R1.5: Evolving Physical Intelligence via Embodied Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.11324","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Embodied-r1","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2606.11324","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:914b2a23e3fc32a959213b26dc1edb583c94481860d84607a7506fe92ab29518","observation_id":"40513af3-cfa8-4723-8f19-3c1572883530","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.02881","last_updated":"2026-05-08T04:21:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-04T17:51:21Z","title":"MolmoAct2: Action Reasoning Models for Real-world Deployment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.02881","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Molmoact2: Action reasoning models for real-world deployment","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2605.02881","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:64d78d9c57ee4ede5fc9c7eaf19b756420a0e747cfb9843418ab89d6822dbbdb","observation_id":"7093daec-0540-48bc-a710-2b00f05698e1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.17846","last_updated":"2026-06-17T17:06:39Z","snapshot_observed_at":"2026-08-01T08:00:11.218777Z","submitted_at":"2026-06-16T12:14:39Z","title":"Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.17846","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Qwen-robotmanip technical report: Alignment unlocks scale for robotic manipulation foundation models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2606.17846","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0cc0cbf4be57940ef883e3edb22a3f278d091644b4c665370212112f861475ce","observation_id":"a1a78ed6-52c2-4e16-9127-fcb0dc4d66a5","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Abot-n0: Technical report on the vla foundation model for versatile embodied navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:ae02950d8b1fb0a1744a93e5073550ee883175fcae4b9c54a8e5093f0cc189b8","observation_id":"5af40899-3c4d-49ba-83e9-a1d7e7a60108","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gemini Robotics-ER 1.6: Powering real-world robotics tasks through enhanced em- bodied reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:e39510aeeba560c5436047579b94a38cc403f1d4fdc8b901e576f1c6ed9a18eb","observation_id":"faaff22f-dfa0-47c9-8ab1-15d592b83ca9","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Introducing helix 02: Full-body autonomy, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:ae709a295ca2e3d2c4af2a8bfeb3e66d3df344cbc2ad606f1ea46358e1d049d7","observation_id":"fcf9ce38-f87e-4df2-a044-3f947ac31eaf","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications, and opportunities","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:c13533a6cc55b6ded262f970d9c96351c885606aa3a9bd6100ed529fc9208c33","observation_id":"e8e959ef-3a8e-47aa-9716-2f0f78c9795c","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0199a2f78cf1272909109a1dc968ac3c5d6d95d8162df1be3d8f6da81134789c","observation_id":"c77a7c9f-8fed-43b9-914a-4b149fa1fc46","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:7431129eb3ff00b954c241e7c185677ea00c1bdccb178e78429d33f14c812d15","observation_id":"c260d960-5da1-4142-80a2-d5343894d2a4","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gpt-4o system card.https://openai.com/index/gpt-4o-system-card/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0042a7524bef556f4b7d61efe3992333029bb7337e5cd28244b9c2f5571dba28","observation_id":"f058b581-ad60-4015-b802-a7787c392e00","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Claude sonnet 4","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:65b684a4d574f376b465202d942bad805ddf7d78ac93efc88d7a7f5702de273d","observation_id":"c7c7f3ab-af64-4758-81aa-258786bb90f7","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"SpatialVLM: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f0dd490b26554b345705df1773fe578fe5d84a83d5b2897ce42d360eb20b8ed3","observation_id":"b8cdf4f8-057f-405f-a32c-8e1666e9c794","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RoboPoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:3c9bcb90f6fe1724dc57c9219eab5674e4b1bb130edb5ebbea55bdc85c3f1b39","observation_id":"151f5f20-ec80-4fa0-a285-f1b30583eee6","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RoboRefer: Towards spatial referring with reasoning in vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:df1d5de6f9424ccf19a98d983bc57415e81e744e323f88c4f0662110fd02beea","observation_id":"1932c905-de85-4bc3-bd57-fff28e24d2d1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Robobrain: A unified brain model for robotic manipulation from abstract to concrete","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:4cf019c38865de43f604150213784ebd5e658e05f11868ff5e64b695e58318f7","observation_id":"74304a63-58e8-45f6-8b5c-011c187abc7a","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Robobrain 2.5: Depth in sight, time in mind","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:5e9d87e8a8ef798b4b3c49e4a66c3bc11ed0ee86b1f70d4bb0dbc0b557c5922f","observation_id":"ee474def-3ff1-4243-ac9b-1e9352afacc3","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.16518","last_updated":"2026-04-28T11:37:12Z","snapshot_observed_at":"2026-07-06T22:36:30.947164Z","submitted_at":"2025-11-20T16:34:55Z","title":"MiMo-Embodied: X-Embodied Foundation Model Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.16518","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Mimo-embodied: X-embodied foundation model technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2511.16518","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:157e567cea341dc381af4a50559c8870d797ec645a72573a4e0377b7ee8bbe60","observation_id":"ed0ca22f-7515-4283-99ad-b1a05dfdc1ec","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00123","last_updated":"2025-05-30T18:00:34Z","snapshot_observed_at":"2026-07-06T21:34:00.849404Z","submitted_at":"2025-05-30T18:00:34Z","title":"Visual Embodied Brain: Let Multimodal Large Language Models See, Think, and Control in Spaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00123","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Visual embodied brain: Let multimodal large language models see, think, and control in spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2506.00123","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:dd47db6b3bd4a876ba684ef6656f51cb0a7c93dd4ddff3433ee563d624b37df5","observation_id":"5ca3a554-d397-484d-9748-597a412c8479","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02029","last_updated":"2025-09-14T06:49:43Z","snapshot_observed_at":"2026-07-06T21:51:19.351544Z","submitted_at":"2025-07-02T17:05:33Z","title":"RoboBrain 2.0 Technical Report","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02029","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Robobrain 2.0 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2507.02029","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f51f194f7c3322e630639f612af4a1314197a259e74c9e76bb63a6642a7a09d8","observation_id":"eddaea49-160f-4f46-b2b9-b8d3487ef1b8","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vlaser: Vision-language-action model with synergistic embodied reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:e232ae6a9ca9b7771d992ceb8a8b8e2cb441425c83ab2349e270a88cf12a82a6","observation_id":"d583d91a-6417-459d-9fa6-2ebbc8e914b1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Pelican-vl 1.0: A foundation brain model for embodied intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:31c47700a882b809bf496bbd35a0f4be66d82ca0923cfaa2d28215bdf436aa75","observation_id":"54080e52-ce8c-4bf5-8b82-f3fd26ad96ca","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RT-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:e4ae35f3ad934fa59a6e45dbe1fa0190dd031b43b2de4be92cf52fdf3a0cdd82","observation_id":"1e99e69a-0033-4827-92e4-02b8173ea7d9","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RT-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:480f447e0d9ab457982bb516d328f6bf7478aaccd24b5679e0b6be4aceadb1b0","observation_id":"04acb0ba-45d5-4c32-9959-c7cc41d7fe34","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f849380d45be7933ae4d5471e14fe4a0caa31179b087f4a1f9bb23f637021ca5","observation_id":"9f8adba5-4552-4e8f-ab10-8e7466f112e5","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a985a7cb40cd4c4492956336ec60e4a2073fc2d9887ac35ba8e605da3f5561b6","observation_id":"90fc8551-ae27-4c8b-9644-2bb77415fc4c","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Open X-Embodiment: Robotic learning datasets and RT-X models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:af83427a56286242224bec435b11d93a91bb59524b23f078c700484e2bd756b6","observation_id":"8ae275de-1280-41ce-b6aa-e200627afc7c","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01823","last_updated":"2024-06-01T01:54:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-04T08:16:11Z","title":"RT-H: Action Hierarchies Using Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01823","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"RT-H: Action hierarchies using language","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2403.01823","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f02201249eac0588bd765202c0040685e3adb9d376c7b8c04ee24c757fe83ae6","observation_id":"d418b3a4-033b-43db-bbc6-a9b3be2dc434","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Eo-1: Interleaved vision-text- action pretraining for general robot control","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:e774b586043d527e44e857fef4903dfe6b992ced2e14211223b76e8d30579e92","observation_id":"4a7f19e4-3639-49ab-bc9d-9727accbdbb9","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"CogACT: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:c153213bc8024f71a04dcf69cc48bfccabe133d2b87d1441da6f380f08677265","observation_id":"bd9eebd2-127e-4c50-a7ef-6a4a573ee6a4","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:d1caeabb025bfa50eb665f53565a7fcd732d55a3abefef658ce41c3c953a5ea8","observation_id":"8f03d772-fc24-432a-adbe-9a25ee457fe9","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.15493","last_updated":"2025-07-22T15:04:37Z","snapshot_observed_at":"2026-07-06T22:00:18.950986Z","submitted_at":"2025-07-21T10:54:13Z","title":"GR-3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.15493","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"GR-3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2507.15493","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:d22fcde80a31ed1d575755f2dc135ed1cdfc548a3c45f73155b56ae15b86adac","observation_id":"60b77533-9dca-4462-84ea-b589a9826d6f","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23202","last_updated":"2026-04-07T13:15:13Z","snapshot_observed_at":"2026-07-06T22:50:19.273712Z","submitted_at":"2026-03-24T13:50:28Z","title":"Gaze-Regularized Vision-Language-Action Models for Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.23202","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gaze-regularized vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2603.23202","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b843c9dc29489b0295227f0678f054c3a63d0414d591988957ea4e7b99c24a11","observation_id":"64cc7f85-a32d-412a-8536-7999f23524a6","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vla-jepa: Enhancing vision-language-action model with latent world model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:1e1cb3cad2ee841c9102404644d6e04b717088ec8785ffa3c8a042adaa1b2453","observation_id":"00cda2d9-a497-42fa-bc7c-0f2268f891c9","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.16163","last_updated":"2026-01-22T18:09:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-22T18:09:30Z","title":"Cosmos Policy: Fine-Tuning Video Models for Visuomotor Control and Planning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.16163","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Cosmos policy: Fine-tuning video models for visuomotor control and planning, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2601.16163","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a477b7e454ae9479b06029e5ad16c25b1c2b4e6fe649635f6bda5d548ed2ac02","observation_id":"28fb3364-9f6d-4b9c-bb42-b091c7ca314a","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Gigaworld-policy: An efficient action-centered world–action model","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0316173e2aa09f3be1ddc4cb9b51240f862e75261fef4f3dad73af95659f1c9d","observation_id":"e10d4955-22cc-4d6d-8715-a21740fe01b3","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.26694","last_updated":"2026-05-07T11:23:39Z","snapshot_observed_at":"2026-07-06T23:12:19.460065Z","submitted_at":"2026-04-29T14:01:54Z","title":"Unified 4D World Action Modeling from Video Priors with Asynchronous Denoising","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.26694","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Unified 4d world action modeling from video priors with asynchronous denoising","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2604.26694","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:39720c7d825758f44ea9cf18e0e7253673091fd5d3cd1f71d64785eb4bb1b546","observation_id":"06d68dd9-aab4-4a75-ac01-3b64f32c5d02","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.16666","last_updated":"2026-03-23T05:41:14Z","snapshot_observed_at":"2026-07-06T22:49:23.750692Z","submitted_at":"2026-03-17T15:33:43Z","title":"Fast-WAM: Do World Action Models Need Test-time Future Imagination?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.16666","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Fast-wam: Do world action models need test-time future imagination?, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2603.16666","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:1b4fe8915ff79cf1b81240914eea5ddfac226290eefeea38ddb08ef01117fd74","observation_id":"7f27a67c-4155-423a-ad86-593274337c6b","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Dreamvla: a vision-language-action model dreamed with comprehensive world knowledge","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:5ba329e89e5d85f3061c76d55bee7407ef873926cd46643713dce8e11c800705","observation_id":"dc0dd1f3-11d3-4dd1-a5cf-5e46182382d5","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00078","last_updated":"2026-04-30T14:16:15Z","snapshot_observed_at":"2026-07-06T23:13:33.799847Z","submitted_at":"2026-04-30T14:16:15Z","title":"Being-H0.7: A Latent World-Action Model from Egocentric Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00078","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Being-h0","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2605.00078","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a191ef98d59b7c71621ed83bca28e74e0e5a198d397284983c30fb0ee486de9b","observation_id":"44eefec1-bbc7-475f-ba4b-1f4a4598dea3","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.17502","last_updated":"2026-05-30T03:49:39Z","snapshot_observed_at":"2026-07-06T22:36:40.133596Z","submitted_at":"2025-11-21T18:59:32Z","title":"RynnVLA-002: A Unified Vision-Language-Action and World Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.17502","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Rynnvla-002: A unified vision-language-action and world model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2511.17502","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b5712f54e59d7f22fbde3a42e2fe8240b3c1795a34b97d328422865bac13d380","observation_id":"a247e9bc-0198-4fa9-bb9f-c4e5dc329c98","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.00678","last_updated":"2026-07-06T08:13:44Z","snapshot_observed_at":"2026-07-12T09:22:06.947773Z","submitted_at":"2026-07-01T09:21:20Z","title":"ABot-M0.5: Unified Mobility-and-Manipulation World Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.00678","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Abot-m0.5: Unified mobility-and-manipulation world action model, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2607.00678","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:5b92007138b0f047d84f069d421b013d9b8218f2591a9d974b57bc8e1cb60bb4","observation_id":"17b0e8c8-93d0-4fd3-81e9-bb74d27b390a","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environments","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:7b02d25cc6bb1c5bfd03078a1bb1a295adfcdfef59336c1222a3211fa82b49a9","observation_id":"864dbc8a-3285-493e-9047-ba9db8359042","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Think global, act local: Dual-scale graph transformer for vision-and-language navigation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:5583a45501f5de4f707f51940bc5375ae406952c5426720f0d9172585bf7d9b5","observation_id":"9afdb9af-1361-45b3-874b-699a4d12c1c2","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Beyond the nav-graph: Vision- and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f8fadcb5e6e50eb1d1a34021470921ad67605422a0e4ad59842c1c6762b1d299","observation_id":"962e6fd2-29f4-4a41-83a8-5a31522491e1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vision-and-language navigation with foundation models: A survey","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b086e8f4de5fc814f9e13f9dcd585efd63453390fe00a77cb4d3f472423ee0f3","observation_id":"c34dd25f-b779-4a85-b762-077e359d9d4e","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Navgpt: Explicit reasoning in vision-and-language navigation with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:01cb56d9a9343fe9f1a6c69fee33c0d1f2a4fcdcad089dc151ac9dd8c085cfbf","observation_id":"3555cc1c-fdbb-4dee-bd49-a9e4733fe0df","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Navid: Video-based vlm plans the next step for vision-and-language navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:68ec92c7cdbe552267c35a070b7166232a40faae230446eae3828f905481a0e2","observation_id":"96c27ba5-01f0-46d9-8c3d-54894c5a31b1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-07-06T20:02:21.509050Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Navila: Legged robot vision-language-action model for navigation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:968565a0b749b128bdd70b5c10956636409747e2455e889b95cffc9249e110c1","observation_id":"60e3694c-c7e2-4522-8943-3ba9f774cccf","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-07-06T20:03:42.903210Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Uni-NaVid: A video-based vision-language-action model for unifying embodied navigation tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:fe61c80d9dcc8e64c40609d3adb99a093825bd30a7b0f27e33880e9f8fd0ac12","observation_id":"761b0e6b-5041-4c56-a8a9-cded259122ca","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.05240","last_updated":"2026-07-09T06:53:43Z","snapshot_observed_at":"2026-07-31T04:11:07.384159Z","submitted_at":"2025-07-07T17:49:41Z","title":"StreamVLN: Streaming Vision-and-Language Navigation via SlowFast Context Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.05240","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Streamvln: Streaming vision-and-language navigation via slowfast context modeling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2507.05240","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:9bf6b9bebf6442f351aaf82f043c6dab92ce114cbf6c452b77619791a6580f84","observation_id":"eb84062f-aa1c-4a85-998a-0afa452ba9d4","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Octonav: Towards generalist embodied navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f16fd34767de2ac09d1ef3e9f2546b3ef26c6966ee64ef3e76df072b4b3fdc77","observation_id":"3dd353ec-0325-4b1e-a3be-8dbbf91a841d","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Agentvln: Towards agentic vision-and-language navigation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:3164b5951e8c00ae9647ea9308278505d6d670ee73278b6741356dbf5665c431","observation_id":"4b54c8f8-097f-43fa-8587-5fb801c461e4","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Learning goal-oriented language-guided navigation with self-improving demonstrations at scale","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:b18164ea6aad035b1d5685fe29a5e14d7c329dbd6fa7c08ba9359874c0573af6","observation_id":"56c67dc1-15b3-4d69-9282-3dd02bd454cf","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Endowing embodied agents with spatial reasoning capabilities for vision-and-language navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:480aadce6955f3c2a6b4938055503b1112cfea0c33a8090ae0110a6167393bb3","observation_id":"b095cb67-ab07-492c-a945-66d2ae287efe","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.25415","last_updated":"2026-05-26T13:51:36Z","snapshot_observed_at":"2026-08-02T05:36:25.863977Z","submitted_at":"2026-03-26T13:10:08Z","title":"Modernising Reinforcement Learning-Based Navigation for Embodied Semantic Scene Graph Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.25415","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Modernising reinforcement learning-based navigation for embodied semantic scene graph generation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2603.25415","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a3e3d74d4f3bedf5723cf3905ab953b2ef948a61bfb7fe0154bff428d3cdb245","observation_id":"78ec595b-d2f1-43c8-92c3-d324399c5d5c","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Sontakke, Jesse Zhang, S´ ebastien M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:652c5f4e49683dc3d15a9bd436ce14a68081f618d651a23203e0d761b4222d08","observation_id":"ef660308-8d90-414f-a3a0-d47002b0ef05","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"VIP: Towards universal visual reward and representation via value-implicit pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:ef22b3037829fbaa3950aecb86e0b6a4341e39e9f7d6cfedbc70f940019fe4fd","observation_id":"5210083a-0d52-47c4-8368-140dff9f04df","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vision language models are in-context value learners","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:fe4c111411f143e63bc133b324509e93b17d82fbc2292c0eb4651f3af3c02eec","observation_id":"0da25528-39c7-47c1-8aec-daaa5b5ee79f","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Vision-language models are zero-shot reward models for reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:5098f9ca39531d9c274c2293bcb8a04eef21cecdad533781cd564b529c471a93","observation_id":"ffbd59dc-0b7b-4f66-98bd-2681944d382f","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.06665","last_updated":"2025-08-29T04:07:26Z","snapshot_observed_at":"2026-07-06T14:17:30.922581Z","submitted_at":"2022-11-12T13:52:06Z","title":"A Survey on Explainable Reinforcement Learning: Concepts, Algorithms, Challenges","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.06665","snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"A survey on explainable reinforcement learning: Concepts, algorithms, challenges","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"cited_paper":"/paper/2211.06665","citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:f21f41fe6504e2127e2d90042e125c237703e57658b392d04ccc05c879198cc2","observation_id":"98b95458-49aa-49e0-901c-a1c5c83564b1","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"LIV: Language-image representations and rewards for robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:111c716e2f4613c45b2f3cb759ca548b1e3dfd8a90f163cff9f920542e072a23","observation_id":"f6b3acb4-899d-4215-be04-9d528e4b7861","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Rank2Reward: Learning shaped reward functions from passive video","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:3b423d2e17e5d929aab316748e56699d8f47c0bf52d2afeb4b0e39bd8d507075","observation_id":"de4c356b-7ed9-4a73-838d-4f50e6e14b46","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"Lim, Jesse Thomason, Erdem Biyik, and Jesse Zhang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:a2c6f97c6ce9cd255ded7be0506b58d162f7555f20ba9ebdbd35370179c16fa1","observation_id":"0e60e437-ce27-4d9d-be2a-21ebdd005052","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T19:16:57.396710Z","title":"SARM: Stage-aware reward modeling for long horizon robot manipulation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-11T19:16:57.396710Z"},"links":{"citing_paper":"/paper/2607.04426"},"observation_digest":"sha256:0d4023d0fad965e7c0f6a7e6e8a83bd66f0c599694dadd8e107dc79a1a72359a","observation_id":"b89c608b-c6f5-45a1-88db-14a7e3f1d15d","resolution":{"observed_at":"2026-07-11T19:16:57.396710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04426","last_updated":"2026-07-05T17:43:06Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T16:12:54.212857Z","submitted_at":"2026-07-05T17:43:06Z","title":"ACE-Brain-0.5: A Unified Embodied Foundational Model for Physical Agentic AI"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":100,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":169},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-02T06:30:47.504484+00:00","source":"crossref"},{"observed_at":"2026-08-02T06:30:44.765945+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 100 of 169 outbound references and 0 inbound Pith citation observations for arXiv:2607.04426."}