{"as_of":"2026-08-06T21:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:61a4a20c8c38f2242eda662cdea8b0a6a8214036a83e2912600d9d3c89a643c4","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T11:38:13.498305Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T11:22:18.092130Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.03896","snapshot_observed_at":"2026-08-02T11:22:18.092130Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.15587","last_updated":"2026-07-15T04:55:13Z","snapshot_observed_at":"2026-08-06T15:14:44.084214Z","submitted_at":"2026-06-14T04:15:29Z","title":"Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T11:22:18.092130Z"},"links":{"cited_paper":"/paper/2510.03896","citing_paper":"/paper/2606.15587"},"observation_digest":"sha256:d1b511984c41abf19bc8283644eb472fdfa0ca61185e636135811e2b85f0e0f1","observation_id":"fad50f49-4c1f-4da1-b74b-0cb4730dc5e8","resolution":{"observed_at":"2026-08-02T11:22:18.092130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2510.03896/citation-record","integrity":"/paper/2510.03896/integrity","json":"/paper/2510.03896/citation-record.json","paper":"/paper/2510.03896"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-04T11:38:10.868380Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:10.868380Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:4520273a46112ca9ad84376fbde40b4d17952ae9459e25822d0539d66fcda140","observation_id":"2d900af5-13e9-4ed3-aca9-08bb3fb1440e","resolution":{"observed_at":"2026-08-04T11:38:10.868380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:10.969501Z","title":"Scanqa: 3d question answering for spatial scene understanding","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:10.969501Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:215c2a2b32a6a3b1d73c90628fa712e96372e33d33ad5cbab9d35fbbe0ac510e","observation_id":"6705dc5a-d02e-4859-a0be-361af795ee73","resolution":{"observed_at":"2026-08-04T11:38:10.969501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T11:38:11.153441Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.153441Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:f4408eb846b298559bca9c4365487f224c39b1a00a904a86bd21ff2207b389a0","observation_id":"22d43650-fc58-4a76-a549-742549b60f62","resolution":{"observed_at":"2026-08-04T11:38:11.153441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-04T11:38:11.242201Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.242201Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:f4e1952fb9d1773ad77f71eb00c3cf8b01fbb4c90632de824f6808fc0519cefa","observation_id":"0f4400bf-11f6-448c-80b1-8118337a3ae2","resolution":{"observed_at":"2026-08-04T11:38:11.242201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-04T11:38:11.335522Z","title":"0: A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.335522Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:ad653090444a59ad96b28c58af817b0eadd400586b19dbffb103f4a106ec0b96","observation_id":"af236d71-a32a-46f2-817b-9cfa4657666f","resolution":{"observed_at":"2026-08-04T11:38:11.335522Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-04T11:38:11.436484Z","title":"Rt-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.436484Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:a875560f882b1a7124c54ca4f39c9130d89aa1fb4aceaa393e9f82462d6ed28c","observation_id":"a001cdba-79fd-4e4c-a41f-6d415ef4c3ce","resolution":{"observed_at":"2026-08-04T11:38:11.436484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13642","last_updated":"2025-03-19T05:09:14Z","snapshot_observed_at":"2026-08-05T18:02:56.273979Z","submitted_at":"2024-06-19T15:41:30Z","title":"SpatialBot: Precise Spatial Understanding with Vision Language Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13642","snapshot_observed_at":"2026-08-04T11:38:11.546062Z","title":"Spatialbot: Precise spatial understanding with vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.546062Z"},"links":{"cited_paper":"/paper/2406.13642","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:21ecd627df251325d7945ef1bbc06276f606d79a37b6b3a504212a418914fc3d","observation_id":"82cd167f-a1ad-452d-a6d8-9646c13e431c","resolution":{"observed_at":"2026-08-04T11:38:11.546062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06158","last_updated":"2024-10-08T16:00:47Z","snapshot_observed_at":"2026-08-03T02:22:13.984027Z","submitted_at":"2024-10-08T16:00:47Z","title":"GR-2: A Generative Video-Language-Action Model with Web-Scale Knowledge for Robot Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06158","snapshot_observed_at":"2026-08-04T11:38:11.692188Z","title":"Gr-2: A generative video-language-action model with web-scale knowledge for robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.692188Z"},"links":{"cited_paper":"/paper/2410.06158","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:854b23496643cb727f5d2d2486862a2ec8c02e0104433807794c11d322350844","observation_id":"05fd20a6-dd03-4bbc-9684-6b345a15f7fa","resolution":{"observed_at":"2026-08-04T11:38:11.692188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:11.808245Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.808245Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:d4e9b228b7ca84f63adb22be706851bd9189b04a51345011cfd17727e611b8a7","observation_id":"8df2d820-c8ec-48a7-8ca2-f4c336bedee6","resolution":{"observed_at":"2026-08-04T11:38:11.808245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18088","last_updated":"2025-08-27T17:52:42Z","snapshot_observed_at":"2026-08-01T01:17:47.017808Z","submitted_at":"2025-06-22T16:26:53Z","title":"RoboTwin 2.0: A Scalable Data Generator and Benchmark with Strong Domain Randomization for Robust Bimanual Robotic Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18088","snapshot_observed_at":"2026-08-04T11:38:11.918624Z","title":"Robotwin 2.0: A scalable data generator and benchmark with strong domain randomization for robust bimanual robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.918624Z"},"links":{"cited_paper":"/paper/2506.18088","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:c005286d19a17ff49230f943e7d837cb8b6101a9a3c28115886a4b68aa4ba362","observation_id":"9ad3a46d-2789-40c0-b865-6db929e8ff25","resolution":{"observed_at":"2026-08-04T11:38:11.918624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:11.993007Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:11.993007Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:f48e40793d22bb8472de40f6886c456d4cf1ac71e7d30bac503707be39338fe4","observation_id":"279af389-e07f-402e-bdd3-e0b5bfc62529","resolution":{"observed_at":"2026-08-04T11:38:11.993007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:12.100181Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.100181Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:c0716874992e43be11b8e146afcfc69861e3fc2a8e27c817d943b92f4865e23c","observation_id":"7e675eba-69f5-4df3-bb12-2f2943dcfa79","resolution":{"observed_at":"2026-08-04T11:38:12.100181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10329","last_updated":"2024-03-06T00:11:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-15T21:11:50Z","title":"Universal Manipulation Interface: In-The-Wild Robot Teaching Without In-The-Wild Robots","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10329","snapshot_observed_at":"2026-08-04T11:38:12.265273Z","title":"Universal manipulation interface: In-the-wild robot teaching without in-the-wild robots","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.265273Z"},"links":{"cited_paper":"/paper/2402.10329","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:0d7aacffe8ba0f1e68b2966eb48f309f372388a83b5efc43dbd057ffb8b6d111","observation_id":"29a74409-cc0b-4786-930c-808c8faed2bf","resolution":{"observed_at":"2026-08-04T11:38:12.265273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-04T11:38:12.335682Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.335682Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:f45a21725d3df6304aeb0d02526b6eef1f250ac9e80b5c15daf51aa741c7f4b4","observation_id":"08cb888e-ccde-436b-ae5b-2e8a66ba4363","resolution":{"observed_at":"2026-08-04T11:38:12.335682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:12.493377Z","title":"Scaffolding dexterous manipulation with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.493377Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:925966fa3a4bb0e9a07b96cf9cdd36c14271cedeb61ceed2f071587fd457ebad","observation_id":"32f7666a-c50a-4aa0-b068-6f52022e29fe","resolution":{"observed_at":"2026-08-04T11:38:12.493377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:12.497568Z","title":"Self-supervised 6d object pose estimation for robot manipulation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.497568Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:862b5fb0ef2412ea77fe9cb8b0a81dd2655731921d2e361c7b15020df610628f","observation_id":"919b4223-84d1-41d7-ab4a-ef74e918ee6a","resolution":{"observed_at":"2026-08-04T11:38:12.497568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:12.558690Z","title":"Scaling up and distilling down: Language-guided robot skill acquisition","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.558690Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:84bed6f93f73b06ce3418e8038bf8e2e7c4da00577c33f1d866df5e40f384187","observation_id":"1f8e2b77-a258-4feb-bfd2-716c672679e3","resolution":{"observed_at":"2026-08-04T11:38:12.558690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.16815","last_updated":"2025-09-18T16:26:53Z","snapshot_observed_at":"2026-08-03T17:16:24.219569Z","submitted_at":"2025-07-22T17:59:46Z","title":"ThinkAct: Vision-Language-Action Reasoning via Reinforced Visual Latent Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.16815","snapshot_observed_at":"2026-08-04T11:38:12.597166Z","title":"Thinkact: Vision-language-action reasoning via reinforced visual latent planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.597166Z"},"links":{"cited_paper":"/paper/2507.16815","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:734a2d0cdc10d5f1c66b5b24ff45cb992bb7c978cecc07d90e79a7a0ba7cfaee","observation_id":"17140e0d-69c7-4021-b9ea-cb64e3f452a5","resolution":{"observed_at":"2026-08-04T11:38:12.597166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-04T11:38:12.607785Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.607785Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:37fd1e9994cbaafeb541898bffce8488f5629164fa14dad7745b5f2dcee0c17d","observation_id":"13847b29-9fb7-4c7a-8aea-0ed219205bcd","resolution":{"observed_at":"2026-08-04T11:38:12.607785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.12271","last_updated":"2019-09-26T17:26:18Z","snapshot_observed_at":"2026-07-06T08:24:58.301676Z","submitted_at":"2019-09-26T17:26:18Z","title":"RLBench: The Robot Learning Benchmark & Learning Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.12271","snapshot_observed_at":"2026-08-04T11:38:12.683587Z","title":null,"venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.683587Z"},"links":{"cited_paper":"/paper/1909.12271","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:6796be3ac116304aec827f192941cb5b81202b96d160680321323d012ffac1a4","observation_id":"0a948c24-6221-4b87-8eb5-5b8394f2e3e1","resolution":{"observed_at":"2026-08-04T11:38:12.683587Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-04T11:38:12.748225Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.748225Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:78e41ab19c415d257a3a89116ff7d685f792745c0dc95f62a84ff65edd830c67","observation_id":"734ae0d1-e69f-47f5-bbf1-55a898605f32","resolution":{"observed_at":"2026-08-04T11:38:12.748225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-04T11:38:12.801414Z","title":"Openvla: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.801414Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:7430f947a9382859045b68beb70c750396f1e6761d99ede595282ab70d48b040","observation_id":"1eebb37f-6828-4727-a160-afaa9ffe3db8","resolution":{"observed_at":"2026-08-04T11:38:12.801414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:12.894192Z","title":"Bridgevla: Input-output alignment for efficient 3d manipulation learning with vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.894192Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:9365729c300b92fd84f2ba565f7a9e596b992ee942e98ad03f6803c363aaf5eb","observation_id":"52c4124a-de9b-46dc-ba94-7af6e168a164","resolution":{"observed_at":"2026-08-04T11:38:12.894192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:12.951626Z","title":"HAMSTER : Hierarchical action models for open-world robot manipulation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:12.951626Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:4198cf6c3c686d00cef214027d99f1fdc6e94a958199df6099740bd212ee85dd","observation_id":"a54cd10d-8683-4f48-8073-6f64ff67f654","resolution":{"observed_at":"2026-08-04T11:38:12.951626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.025352Z","title":"Prompting depth anything for 4k resolution accurate metric depth estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.025352Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:a8fa2e10dba12231639e3784ef623fe50a5e1f8916f963e5d500e8270ce579bd","observation_id":"195ee994-4ee7-483f-ba29-b6c5f258fcda","resolution":{"observed_at":"2026-08-04T11:38:13.025352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.098297Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.098297Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:bef0da6fb63beea5c1072d07d1c9b4d0e3aa93378062892d50260630b7193e42","observation_id":"576ef1ba-c230-49ed-831c-ed82bcd84797","resolution":{"observed_at":"2026-08-04T11:38:13.098297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07474","last_updated":"2023-04-12T20:05:41Z","snapshot_observed_at":"2026-07-06T14:05:02.813765Z","submitted_at":"2022-10-14T02:52:26Z","title":"SQA3D: Situated Question Answering in 3D Scenes","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07474","snapshot_observed_at":"2026-08-04T11:38:13.152895Z","title":"Sqa3d: Situated question answering in 3d scenes","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.152895Z"},"links":{"cited_paper":"/paper/2210.07474","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:867248cfd884fc40ccd8578bf091f564cb6e149c3ce4872e346b0d816e7e08d8","observation_id":"959ea317-4073-4a7c-9901-74d0171b7331","resolution":{"observed_at":"2026-08-04T11:38:13.152895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.225909Z","title":"kpam: Keypoint affordances for category-level robotic manipulation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.225909Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:9f449cf65cdb1033238cc423116f25fba85eebdcc13895f475952dc890071f2c","observation_id":"0a397153-fde4-4e7b-a501-db2898e6790e","resolution":{"observed_at":"2026-08-04T11:38:13.225909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.276311Z","title":"Calvin: A benchmark for language-conditioned policy learning for long-horizon robot manipulation tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.276311Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:c2553dc2a11bb2e2689c2e1240c2b7bda55fe6314d0c03799b20aafe7136e8fb","observation_id":"9926a2c0-886b-478c-9937-5def87db0754","resolution":{"observed_at":"2026-08-04T11:38:13.276311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.14483","last_updated":"2021-11-04T12:11:21Z","snapshot_observed_at":"2026-07-06T11:34:01.629249Z","submitted_at":"2021-07-30T08:20:22Z","title":"ManiSkill: Generalizable Manipulation Skill Benchmark with Large-Scale Demonstrations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.14483","snapshot_observed_at":"2026-08-04T11:38:13.289266Z","title":"Maniskill: Generalizable manipulation skill benchmark with large-scale demonstrations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.289266Z"},"links":{"cited_paper":"/paper/2107.14483","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:1937474385650c53f425a063d057d44a6ef60691a089c6ac2bb1c5af8e1802d9","observation_id":"daa0b88f-8771-4e6e-a980-9cd149283765","resolution":{"observed_at":"2026-08-04T11:38:13.289266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.306390Z","title":"Robotwin: Dual-arm robot benchmark with generative digital twins","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.306390Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:306d8f9b35d3dec3c3433aabc686c3220b8288baaaec5ea3948a367d41839fd1","observation_id":"387ae6f5-2860-4825-a704-bace5ed2cee4","resolution":{"observed_at":"2026-08-04T11:38:13.306390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-04T11:38:13.368955Z","title":"Sam 2: Segment anything in images and videos","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.368955Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:2df7342b1d0563e6fee19047e93dc106bbc7b74269502c29620f1d0f3e0c2989","observation_id":"e263d66e-97ae-4088-8561-2a0cd2d5ac01","resolution":{"observed_at":"2026-08-04T11:38:13.368955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.395854Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.395854Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:ff95eb8200b1c685f6b8d8cf9393455f1f1b6200cd5ada6958ec331055fa8c87","observation_id":"70a06a49-00d6-4534-847b-aa12e09232a0","resolution":{"observed_at":"2026-08-04T11:38:13.395854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-04T11:38:13.401007Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.401007Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:936f383b83d312a04e7dd11593bf20916a55610fb802d73f1d7311073aa0ed75","observation_id":"650977dc-7803-430f-8789-c6633c2bd482","resolution":{"observed_at":"2026-08-04T11:38:13.401007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12952","last_updated":"2024-01-17T22:41:29Z","snapshot_observed_at":"2026-08-02T23:50:48.668259Z","submitted_at":"2023-08-24T17:41:20Z","title":"BridgeData V2: A Dataset for Robot Learning at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12952","snapshot_observed_at":"2026-08-04T11:38:13.405332Z","title":"Vuong, Andre Wang He, Vivek Myers, Kuan Fang, Chelsea Finn, and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.405332Z"},"links":{"cited_paper":"/paper/2308.12952","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:c451e38a9460385124a86e0788bdcdb81e40ad96ad862497949b9045e8985920","observation_id":"25ec5aa9-862a-47ef-8dd8-9108bc52f29d","resolution":{"observed_at":"2026-08-04T11:38:13.405332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.409770Z","title":"Moge: Unlocking accurate monocular geometry estimation for open-domain images with optimal training supervision","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.409770Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:aaf70460a7ba625f2e0104342c29463ff61353f3755cfa2ac8c8274818b19e15","observation_id":"597428a9-45f2-4bd1-802d-fa2d95a161f1","resolution":{"observed_at":"2026-08-04T11:38:13.409770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02546","last_updated":"2025-07-03T11:40:01Z","snapshot_observed_at":"2026-07-06T21:51:38.554688Z","submitted_at":"2025-07-03T11:40:01Z","title":"MoGe-2: Accurate Monocular Geometry with Metric Scale and Sharp Details","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.02546","snapshot_observed_at":"2026-08-04T11:38:13.413876Z","title":"Moge-2: Accurate monocular geometry with metric scale and sharp details","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.413876Z"},"links":{"cited_paper":"/paper/2507.02546","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:1bd304836a522b69cd77d378d85f5732abd6e802aa38070f555da2c62d14e58b","observation_id":"5e109b2d-7d5b-42b7-bdb5-ed74b2153ac5","resolution":{"observed_at":"2026-08-04T11:38:13.413876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18265","snapshot_observed_at":"2026-08-04T11:38:13.418183Z","title":"Internvl3","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.418183Z"},"links":{"cited_paper":"/paper/2508.18265","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:1b367c164a1570aa52fd489b1269892f159ebd7ba3187ff4945799e12bec9f11","observation_id":"138c9e56-7323-4260-8dea-f6e977e5bb73","resolution":{"observed_at":"2026-08-04T11:38:13.418183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.423043Z","title":"Foundationstereo: Zero-shot stereo matching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.423043Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:2a9d482fee5b9fbedaf3179d7455ed53d12f836c9b9873cf0bd5ad142de69f57","observation_id":"ddbf931c-423d-421a-a4ca-cfe55191a39c","resolution":{"observed_at":"2026-08-04T11:38:13.423043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.428374Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.428374Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:7fab2ae5afd0197b7aed1b73dd128abfe3457a8d348e2604840d6371d467b512","observation_id":"1655f0b4-1bce-43e9-9eca-17c7231d6702","resolution":{"observed_at":"2026-08-04T11:38:13.428374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23747","last_updated":"2026-05-19T02:23:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-29T17:59:04Z","title":"Spatial-MLLM: Boosting MLLM Capabilities in Visual-based Spatial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23747","snapshot_observed_at":"2026-08-04T11:38:13.433037Z","title":"Spatial-mllm: Boosting mllm capabilities in visual-based spatial intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.433037Z"},"links":{"cited_paper":"/paper/2505.23747","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:82d9bfe184e2a7fbed0e6ac1441b2d7d1de3bd50cfedec75ec233ed39371e82f","observation_id":"aef902b5-d35d-451b-b1fe-b0ee836e13e7","resolution":{"observed_at":"2026-08-04T11:38:13.433037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.437718Z","title":"Afforddp: Generalizable diffusion policy with transferable affordance","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.437718Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:290ed3cec004d32435d6725de3c16d5b6885b67930506dd5f23dc60ba37f4ab6","observation_id":"c7ae41c6-2b58-4834-a6a3-0db3b2ad9e46","resolution":{"observed_at":"2026-08-04T11:38:13.437718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.441892Z","title":"Magma: A foundation model for multimodal ai agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.441892Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:6a9126e4f9e2c62679eadea84e716d977c160c1827fcc683a8b19e09d9188884","observation_id":"91e98a71-d931-4be9-bace-b0c105635ad6","resolution":{"observed_at":"2026-08-04T11:38:13.441892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18738","last_updated":"2025-07-13T02:18:02Z","snapshot_observed_at":"2026-08-03T05:41:49.125371Z","submitted_at":"2025-03-24T14:46:14Z","title":"RoboEngine: Plug-and-Play Robot Data Augmentation with Semantic Robot Segmentation and Background Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.18738","snapshot_observed_at":"2026-08-04T11:38:13.445945Z","title":"Roboengine: Plug-and-play robot data augmentation with semantic robot segmentation and background generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.445945Z"},"links":{"cited_paper":"/paper/2503.18738","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:640e5e140a8290370a1680a82129ccd815d3671a169e1dbf581dadeff9dd8a6d","observation_id":"fd28d95b-6a5b-4eea-992f-11715e562377","resolution":{"observed_at":"2026-08-04T11:38:13.445945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10721","last_updated":"2024-06-15T19:22:51Z","snapshot_observed_at":"2026-07-06T18:31:36.504766Z","submitted_at":"2024-06-15T19:22:51Z","title":"RoboPoint: A Vision-Language Model for Spatial Affordance Prediction for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10721","snapshot_observed_at":"2026-08-04T11:38:13.449967Z","title":"Robopoint: A vision-language model for spatial affordance prediction for robotics","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.449967Z"},"links":{"cited_paper":"/paper/2406.10721","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:8865edf9fbdd8c2b583c1be330d27b540e3a7c887f6ceb984f8272667c639090","observation_id":"faddb885-6fc6-4180-a6fc-477c51cb433b","resolution":{"observed_at":"2026-08-04T11:38:13.449967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03954","last_updated":"2024-09-27T02:43:48Z","snapshot_observed_at":"2026-08-01T16:34:39.855742Z","submitted_at":"2024-03-06T18:58:49Z","title":"3D Diffusion Policy: Generalizable Visuomotor Policy Learning via Simple 3D Representations","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03954","snapshot_observed_at":"2026-08-04T11:38:13.454234Z","title":"3d diffusion policy: Generalizable visuomotor policy learning via simple 3d representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.454234Z"},"links":{"cited_paper":"/paper/2403.03954","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:7afdfd763977da2a9396658758b9d13f00f7f3827e0bd9255a4ae8dc436d6253","observation_id":"9ee241cc-d7f1-4fa1-b556-7415e12d06d2","resolution":{"observed_at":"2026-08-04T11:38:13.454234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.458794Z","title":"Vsr: a unified framework for document layout analysis combining vision, semantics and relations","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.458794Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:5bb08a79505f02484d2cc604ac026791aa34de43c071c9748ee2a085913369be","observation_id":"2780ba4a-2dee-42a6-9abb-90a094268939","resolution":{"observed_at":"2026-08-04T11:38:13.458794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.13705","last_updated":"2023-04-23T19:10:53Z","snapshot_observed_at":"2026-08-03T01:22:01.078078Z","submitted_at":"2023-04-23T19:10:53Z","title":"Learning Fine-Grained Bimanual Manipulation with Low-Cost Hardware","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.13705","snapshot_observed_at":"2026-08-04T11:38:13.463077Z","title":"Learning fine-grained bimanual manipulation with low-cost hardware","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.463077Z"},"links":{"cited_paper":"/paper/2304.13705","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:23ef69c4853b2bb276720f5b9a24d3512c4192e22d551fcac306e09fb2421750","observation_id":"4e2bd3ea-0518-4960-80e2-afdbf464c5ab","resolution":{"observed_at":"2026-08-04T11:38:13.463077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18125","last_updated":"2025-04-27T06:50:23Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:59:11Z","title":"LLaVA-3D: A Simple yet Effective Pathway to Empowering LMMs with 3D-awareness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18125","snapshot_observed_at":"2026-08-04T11:38:13.467839Z","title":"Llava-3d: A simple yet effective pathway to empowering lmms with 3d-awareness","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.467839Z"},"links":{"cited_paper":"/paper/2409.18125","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:ae58c3cf2d1ec474b9f4a5ef7d5cd319c40ed2e8bfcbd3aec1e8594e5053f1cc","observation_id":"d947ec6d-b7b5-4312-a67d-8132fdde69d8","resolution":{"observed_at":"2026-08-04T11:38:13.467839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14386","last_updated":"2023-10-22T18:51:45Z","snapshot_observed_at":"2026-08-05T22:17:30.260482Z","submitted_at":"2023-10-22T18:51:45Z","title":"Learning Generalizable Manipulation Policies with Object-Centric 3D Representations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.14386","snapshot_observed_at":"2026-08-04T11:38:13.473378Z","title":"Learning generalizable manipulation policies with object-centric 3d representations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.473378Z"},"links":{"cited_paper":"/paper/2310.14386","citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:54448655d06a67466fee5b70b889296b43dc8805e58e7eb058a3ed09b170ce3f","observation_id":"ca7e5a22-c2ec-44ce-a298-943c99ef1ec3","resolution":{"observed_at":"2026-08-04T11:38:13.473378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.478000Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.478000Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:ef36ad55a15c3c84fc52a8d93683b5f451c1a57e69f880c275fe5df829130447","observation_id":"874f02d6-8be7-474a-85b9-6ceafd0c4ae5","resolution":{"observed_at":"2026-08-04T11:38:13.478000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.482713Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.482713Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:3bb2a45a05858fd38ed222ae356532d1ee7549ab095ad06a29311194b453c711","observation_id":"f7507841-b0fc-452c-9986-579a0070d8c2","resolution":{"observed_at":"2026-08-04T11:38:13.482713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.488558Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.488558Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:c62f92d86dca81320dc9d141d9f4aa8fd961297fa672ebb946807f081665a66a","observation_id":"db54393f-33c1-48a8-95f4-49bd12982c21","resolution":{"observed_at":"2026-08-04T11:38:13.488558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.493503Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.493503Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:dca7c16e481b4187b4a33ab7981205a32c08d137772c7698ad234699e43164dd","observation_id":"fcef9501-2455-451c-8794-ae8b3fe7d5ff","resolution":{"observed_at":"2026-08-04T11:38:13.493503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T11:38:13.498305Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-04T11:38:13.498305Z"},"links":{"citing_paper":"/paper/2510.03896"},"observation_digest":"sha256:44bfbef9886996a4bd2527a7acd911801e926fdc66c74c8a7e47fa60874ab4d1","observation_id":"f9151aaa-ff97-49ea-8261-45600eaf1ffe","resolution":{"observed_at":"2026-08-04T11:38:13.498305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.03896","last_updated":"2026-06-11T03:17:22Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T11:38:07.520117Z","submitted_at":"2025-10-04T18:33:27Z","title":"GAE: Unleashing Physical Potential of VLM with Generalizable Action Expert"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":54,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 1 inbound Pith citation observation for arXiv:2510.03896."}