{"as_of":"2026-08-04T21:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:94c0d20f9c3b77761a18c6af3f5927914ecdeb87d2286d46f2f97b40c452d22f","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T04:39:19.874610Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.13653/citation-record","integrity":"/paper/2607.13653/integrity","json":"/paper/2607.13653/citation-record.json","paper":"/paper/2607.13653"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.112181Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.112181Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:7624fe7702a45cfd9836f293ea442029afd7c0b4f39238e53e91603dcdb5a8dc","observation_id":"b5d2e345-2a36-4964-9573-44f4219b7395","resolution":{"observed_at":"2026-08-02T04:39:11.112181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.238427Z","title":"Introducing the model context protocol, Nov 2024,https://www.anthropic","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.238427Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:924af12fb06ecb98ca66a20cc21ec6d5d6435fd6795292d9c73d307b637b8201","observation_id":"f09457da-acc1-4ee5-9d30-00415029d864","resolution":{"observed_at":"2026-08-02T04:39:11.238427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.329462Z","title":"Claude haiku 4.5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.329462Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:1171e462f1eada0e08aaf0e5ee18899018aadbc0293c1eda79728f0aedd046eb","observation_id":"d39d4fb6-e044-4fc5-9042-8360771878d2","resolution":{"observed_at":"2026-08-02T04:39:11.329462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T04:39:11.475714Z","title":"Qwen3-VL technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.475714Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:e37d0939e519c06c07905f3038cf03cdc7c98dbaf7d150d45224e6b19b6259ff","observation_id":"af08a7c5-f580-467e-996f-23ed37add78c","resolution":{"observed_at":"2026-08-02T04:39:11.475714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.598867Z","title":"RT-1: Robotics transformer for real-world control at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.598867Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:ba1efa9f0352bdef1ce160377fe404833079075216c8a9cbeeccca53f6208133","observation_id":"6f4a56c4-233c-4b2b-9fdc-18c2759fbeac","resolution":{"observed_at":"2026-08-02T04:39:11.598867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.697884Z","title":"Turner, Eric Undersander, and Tsung-Yen Yang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.697884Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:5bc0e6bd394d451f4cad1ace5c976814754f077c618ecf3a886e4f7fdb3875c1","observation_id":"a4714758-8256-4c57-849d-cdbea09903c6","resolution":{"observed_at":"2026-08-02T04:39:11.697884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.821578Z","title":"Era: Transforming vlms into em- bodied agents via embodied prior learning and online reinforcement learning.arXiv preprint arXiv:2510.12693, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.821578Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:637c794546df39629d60c435e675658187cc54a6f522d8ba91c79a61b990f010","observation_id":"a95ee285-546c-4e49-8faf-517056d2549f","resolution":{"observed_at":"2026-08-02T04:39:11.821578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:11.979512Z","title":"OWMM-Agent: Open world mobile manipulation with multi-modal agentic data synthesis","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:11.979512Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:b076fbf5b60a25a1517b08a0af77d807f525e0ed62e1ea5713b0608bc20a98c9","observation_id":"62aa4743-2054-4fe7-af22-4822d0e6ddb4","resolution":{"observed_at":"2026-08-02T04:39:11.979512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:12.113133Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.113133Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:324c8b1d160693e64b1698272b15ba78447e06d167705d5a3112d11ebce49230","observation_id":"33c4917e-405e-41ce-8079-4a6329c460d1","resolution":{"observed_at":"2026-08-02T04:39:12.113133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-02T04:39:12.301111Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multi- modality, longcontext, andnextgenerationagenticcapabilities.arXivpreprintarXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.301111Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:b97f392c680900dc4c1b106c62ddc9ddf8f16740b1d1855ce688e3a5c27c0cdf","observation_id":"b0ca942f-563f-45cb-ab18-0a95563464f4","resolution":{"observed_at":"2026-08-02T04:39:12.301111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20726","last_updated":"2025-07-29T02:51:37Z","snapshot_observed_at":"2026-07-06T21:31:06.662703Z","submitted_at":"2025-05-27T05:14:50Z","title":"ManiTaskGen: A Comprehensive Task Generator for Benchmarking and Improving Vision-Language Agents on Embodied Decision-Making","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.20726","snapshot_observed_at":"2026-08-02T04:39:12.440926Z","title":"ManiTaskGen: A comprehensive task generator for benchmarking and improving vision-language agents on embodied decision-making.arXiv preprint arXiv:2505.20726, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.440926Z"},"links":{"cited_paper":"/paper/2505.20726","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:c19bf204d63d7d53f4a658c441aa47555682f7bcec213c9ec79dd5a5c968c911","observation_id":"62e2116f-9236-46de-9cc1-b77ce111f607","resolution":{"observed_at":"2026-08-02T04:39:12.440926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:12.582119Z","title":"ProcTHOR: Large-scale embodied AI using procedural generation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.582119Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:d98d6b8fcbdd069587a198b3da95fc21a41378d46255947a081e08ae33823bf2","observation_id":"bb139b4f-e837-4dd5-a76f-95fbe633b026","resolution":{"observed_at":"2026-08-02T04:39:12.582119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:12.717736Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.717736Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:6f23dee8b4f611f01cd53ef292727c4e5408d49cccf84e59009954aa90d22536","observation_id":"5db2da29-18ae-4a35-9ef0-e9f19505237c","resolution":{"observed_at":"2026-08-02T04:39:12.717736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:12.831386Z","title":"Integrated task and motion planning.An- nual Review of Control, Robotics, and Autonomous Systems,4(1), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:12.831386Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:b2ae628aef14b8f69a9d218006bcd82e192b500c8fdb5838f105589d1c070a77","observation_id":"01defcb3-427a-4a9e-8715-ea9428ac0384","resolution":{"observed_at":"2026-08-02T04:39:12.831386Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:13.077983Z","title":"Gemini.https://deepmind.google/models/gemini/, 2025, accessed: June 26, 2026","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:13.077983Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:916f567a9251985515202a43d2d4b296cf2a93b31059ba4d57bbad02524a6fff","observation_id":"d5ab824c-b09b-4e8b-bd3c-bd058ca991bf","resolution":{"observed_at":"2026-08-02T04:39:13.077983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:13.282528Z","title":"Gemini 3 pro model card","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:13.282528Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:3437f2cd95ecf28875c001ea517ad60b9c629066f43be4d50b4a8ad5c11f5b6f","observation_id":"ad1f2af0-0a02-46d2-ab1d-ccc0b4f2b831","resolution":{"observed_at":"2026-08-02T04:39:13.282528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:13.472811Z","title":"InICRA, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:13.472811Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:094b0e71b0616f4d2fb7394d9dcd627ae3a16c8d93cdc5f73f71910920fc9106","observation_id":"ff9c434f-ed90-490e-8968-b597098d0b1c","resolution":{"observed_at":"2026-08-02T04:39:13.472811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:13.721321Z","title":"MesaTask: Towards task-driven tabletop scene generation via 3D spatial reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:13.721321Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:f395d36ec60179fd4b7685475d8de49881a103476e48f9a0b7b579d8ec2d1342","observation_id":"0bb3b431-9c22-43fb-a7cf-73d013cdb5ea","resolution":{"observed_at":"2026-08-02T04:39:13.721321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:13.928057Z","title":"Language models as zero- shot planners: Extracting actionable knowledge for embodied agents","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:13.928057Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:7fd9b905eb2e5435934508086074365d4a28089005406341266a62364e3f7576","observation_id":"de0c1d11-ab22-4e29-8bd2-50307e239d3b","resolution":{"observed_at":"2026-08-02T04:39:13.928057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:14.172604Z","title":"InCoRL, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:14.172604Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:816573a78634f8588b05bf072b1bb6c3f8844c2dd50d8e56f4e6e16533d9dc49","observation_id":"9e281223-4983-43a9-8cb4-cbc30d729600","resolution":{"observed_at":"2026-08-02T04:39:14.172604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.22342","last_updated":"2026-07-26T13:09:53Z","snapshot_observed_at":"2026-08-04T01:35:17.931638Z","submitted_at":"2025-12-26T19:00:12Z","title":"VL-LN Bench: Towards Long-horizon Goal-oriented Navigation with Active Dialogs","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.22342","snapshot_observed_at":"2026-08-02T04:39:14.425394Z","title":"VL-LN bench: Towards long-horizon goal-oriented navigation with active dialogs.arXiv preprint arXiv:2512.22342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:14.425394Z"},"links":{"cited_paper":"/paper/2512.22342","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:78d64917dd10f54f1221e06be7641c3e760cb9681e8462838e7a6bfae9d787e6","observation_id":"bf1c056a-1ebf-4f68-af65-e1d419de92c3","resolution":{"observed_at":"2026-08-02T04:39:14.425394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:14.499683Z","title":"Hierarchical task and motion planning in the now","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:14.499683Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:e91db298121e66eba6e9d953230dc09ac447eedab1aa764852067fd333b8cdd7","observation_id":"f29c3f22-0936-4ede-b31a-9719d10f2d6c","resolution":{"observed_at":"2026-08-02T04:39:14.499683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:14.588111Z","title":"OpenVLA: An open-source vision-language-action model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:14.588111Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:f1bbc300abbf4813ce99f63d1a10f8696ba63d8e77666486802c367085a43335","observation_id":"d5c7de39-78fb-47cf-a5a8-3a7395440043","resolution":{"observed_at":"2026-08-02T04:39:14.588111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05474","last_updated":"2022-08-26T17:12:17Z","snapshot_observed_at":"2026-07-06T06:14:28.435222Z","submitted_at":"2017-12-14T23:17:24Z","title":"AI2-THOR: An Interactive 3D Environment for Visual AI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05474","snapshot_observed_at":"2026-08-02T04:39:14.763064Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:14.763064Z"},"links":{"cited_paper":"/paper/1712.05474","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:9f0a745b9aaa5fa1565f3340a1c4c0922b3c8e808adac8819796043caafc2948","observation_id":"78e15cae-a056-4c78-a2a3-d6abdbf82439","resolution":{"observed_at":"2026-08-02T04:39:14.763064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:14.865889Z","title":"EmboMatrix: A scalable training-ground for embodied decision-making.arXiv preprint arXiv:2510.12072, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:14.865889Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:b2c055d4733acf993e14e43344a79dbff25e10843b686d44a9ecf43786bdaaa7","observation_id":"acd6bd91-2516-439f-a30a-cad3b6f01eb6","resolution":{"observed_at":"2026-08-02T04:39:14.865889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:15.014849Z","title":"Behavior-1k: A benchmark for embodied ai with 1,000 everyday activities and realistic simulation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.014849Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:aceb582a290a820c667584de15617270793a3d956eafbcd800351e3568047d45","observation_id":"a5a0bea2-cbba-48db-adfb-bc4752d91b82","resolution":{"observed_at":"2026-08-02T04:39:15.014849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08604","last_updated":"2025-05-15T01:34:30Z","snapshot_observed_at":"2026-07-06T20:50:47.129038Z","submitted_at":"2025-03-11T16:42:36Z","title":"EMMOE: A Comprehensive Benchmark for Embodied Mobile Manipulation in Open Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08604","snapshot_observed_at":"2026-08-02T04:39:15.160275Z","title":"EMMOE: A comprehensive benchmark for embodied mobile manipulation in open environments.arXiv preprint arXiv:2503.08604, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.160275Z"},"links":{"cited_paper":"/paper/2503.08604","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:7061a41aa0d1d85ab42e6b5ceaf2aafd731687e6a0f0868b21bfb1ce6081bdcd","observation_id":"9aaf6bfb-7bde-43ce-85cb-7ba57d6725f5","resolution":{"observed_at":"2026-08-02T04:39:15.160275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:15.312498Z","title":"Embodied agent interface: Benchmarking LLMs for embodied decision making","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.312498Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:93ec8d51d47b31ca0d12909bf8d0ac31a7c1b41eaf15341af55ff055fc2a7c26","observation_id":"1339d553-fdbd-41c4-afdd-d181080c834f","resolution":{"observed_at":"2026-08-02T04:39:15.312498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:15.423794Z","title":"Code as policies: Language model programs for embodied control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.423794Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:84b35d777dbce701a240990ff595708764156813586e89e72587c76c2d2de69f","observation_id":"37046bad-053c-40a8-9b55-b7f50087d493","resolution":{"observed_at":"2026-08-02T04:39:15.423794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:15.602754Z","title":"Visualagentbench: Towards large multimodal models as visual foundation agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.602754Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:de690af6d74c820f00fb53c42ac256366f60f6b4839d9496f12e83b3dd1da49c","observation_id":"415c2a97-1219-4294-8c6c-8cff94543986","resolution":{"observed_at":"2026-08-02T04:39:15.602754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:15.728167Z","title":"PIVOT: Iterative visual prompting elicits actionable knowledge for VLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.728167Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:ee8ade0bec53c9f1c158271844dcf1165f59f4aa4e76d44bb0fd7aa1d02fd959","observation_id":"27c0aff9-f9f1-4cb7-a287-5c4047606ede","resolution":{"observed_at":"2026-08-02T04:39:15.728167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-02T04:39:15.864325Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.864325Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:6ec9afb1b79ca75b759a63a1666dee0fc94f59b8e3f07f1f7bed045ddd9e0f74","observation_id":"e07e25d0-258b-4848-a0cf-4f7ced2a4082","resolution":{"observed_at":"2026-08-02T04:39:15.864325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-02T04:39:15.943214Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.943214Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:dbfc6332ff8688183a423bd5a8502995780b63301cb0d64007c4475f2517ffe9","observation_id":"b7aad720-59b5-44ae-87f2-3aed17547f6b","resolution":{"observed_at":"2026-08-02T04:39:15.943214Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:15.997720Z","title":"TEACh: Task-driven embodied agents that chat","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:15.997720Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:819bd4caebcbf15933250c01ff68e3873402004c56d15c00966e7a52ea15b613","observation_id":"779f3347-966f-4207-9b17-d0de4feb1ab2","resolution":{"observed_at":"2026-08-02T04:39:15.997720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:16.215345Z","title":"ADAPT: Actively discovering and adapting to preferences for any task","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:16.215345Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:a77154fef49da1638c273019c9a07365c5560de0a5fd916e8773fc2d02b6bc91","observation_id":"33dc6f79-bb84-4cda-b5ef-9429929677b4","resolution":{"observed_at":"2026-08-02T04:39:16.215345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23535","last_updated":"2024-10-31T00:56:08Z","snapshot_observed_at":"2026-07-06T19:42:38.715005Z","submitted_at":"2024-10-31T00:56:08Z","title":"Simulating User Agents for Embodied Conversational-AI","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23535","snapshot_observed_at":"2026-08-02T04:39:16.376799Z","title":"Simulating user agents for embodied conversational-ai.arXiv preprint arXiv:2410.23535, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:16.376799Z"},"links":{"cited_paper":"/paper/2410.23535","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:2acad5150b40d64231ffe122e2c106868c961f930b46708b2a704d50af58b4b2","observation_id":"9f5f378f-a953-4111-ac01-ab9e91df99f9","resolution":{"observed_at":"2026-08-02T04:39:16.376799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-02T04:39:16.512801Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:16.512801Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:d069b3debfa701ab1b3a10ce0ad0969e4fb34bdc8116ed11336b85ffdefffdb4","observation_id":"5dd6fd8c-5d4b-462a-943e-a215203b069e","resolution":{"observed_at":"2026-08-02T04:39:16.512801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:16.642873Z","title":"VirtualHome: Simulating household activities via programs","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:16.642873Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:ef95f487760095071fa9dab4e06e7d098f05e1d81ce421d7fdd54107fcd5c8e3","observation_id":"e773479e-b8de-4bab-b714-f2a75fe25920","resolution":{"observed_at":"2026-08-02T04:39:16.642873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-02T04:39:16.791456Z","title":"Qwen2.5 technical report.arXiv preprint arXiv:2412.15115, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:16.791456Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:740de79bc7b94bc1eab826385d7167b142afbf73154b7ba7eb67382ae8423983","observation_id":"766d4de8-a709-481c-bf22-32f460cbd334","resolution":{"observed_at":"2026-08-02T04:39:16.791456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:16.942465Z","title":"Ren, Jaden Clark, Anushri Dixit, Masha Itkina, Anirudha Majumdar, and Dorsa Sadigh","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:16.942465Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:d98846f81345efa54c3ca9ab24ae7fadf9087922b5be76300d3dce403915409f","observation_id":"bad39780-0442-4c72-9136-d42192c1c179","resolution":{"observed_at":"2026-08-02T04:39:16.942465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:17.086142Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.086142Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:30bc64f6861132c47c50d0294d6e305633a76d9e3674e85f47c0fb6aa84af5f2","observation_id":"471680a6-53aa-4b5a-b195-499bd6fb32d8","resolution":{"observed_at":"2026-08-02T04:39:17.086142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14159","last_updated":"2024-01-25T13:12:09Z","snapshot_observed_at":"2026-07-06T17:20:25.138890Z","submitted_at":"2024-01-25T13:12:09Z","title":"Grounded SAM: Assembling Open-World Models for Diverse Visual Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14159","snapshot_observed_at":"2026-08-02T04:39:17.228710Z","title":"Grounded sam: Assembling open-world models for diverse visual tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.228710Z"},"links":{"cited_paper":"/paper/2401.14159","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:1910582ab24d157dc7f8084ac9a81999ae82c9698093121696630b66d2709dd2","observation_id":"b6715171-a342-4143-b12d-9fa82ff74edd","resolution":{"observed_at":"2026-08-02T04:39:17.228710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:17.315262Z","title":"ALFRED: A benchmark for interpreting grounded instructions for everyday tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.315262Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:d2a32e4e31d89f7aa93fb5817d43b67c15e1e2f15836c4332c1e9d36dbe33e8a","observation_id":"cfb745e7-7577-452d-a231-df25e6e752e2","resolution":{"observed_at":"2026-08-02T04:39:17.315262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:17.491282Z","title":"ALFWorld: Aligning text and embodied environments for interactive learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.491282Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:af769fcf446e9a3564eb0a18554d180b5ee0a05f44b266d96d7328207b9d1721","observation_id":"d3b40d3f-14e2-4fe2-8796-c86b1fcb7da6","resolution":{"observed_at":"2026-08-02T04:39:17.491282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04157","last_updated":"2024-02-20T11:38:09Z","snapshot_observed_at":"2026-08-04T12:23:05.286310Z","submitted_at":"2024-01-08T18:57:54Z","title":"RePLan: Robotic Replanning with Perception and Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04157","snapshot_observed_at":"2026-08-02T04:39:17.646775Z","title":"Replan: Robotic replanning with perception and language models.arXiv preprint arXiv:2401.04157, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.646775Z"},"links":{"cited_paper":"/paper/2401.04157","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:2d6e51e82a17f20bcc9fb3194f8b13c966cf1f1eb41f5de4684f798d907d77b7","observation_id":"56153de3-8165-4c96-9905-42d219c896c7","resolution":{"observed_at":"2026-08-02T04:39:17.646775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:17.852464Z","title":"Habitat 2.0: Training home assistants to rearrange their habitat","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.852464Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:23e228a149825944d9a11d8f2a72c73b0a46659758dc89c1d9d2580c094474d9","observation_id":"347a116d-1c9d-44ff-a2ac-4d8b9a6caf2a","resolution":{"observed_at":"2026-08-02T04:39:17.852464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:17.997808Z","title":"From multimodal llms to generalist embodied agents: Methods and lessons","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:17.997808Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:776113e8ec2b88e9403aa9045488e939d32825047bc8243a2be4cebb3138ff35","observation_id":"128bcdf9-75a5-495c-a0e4-9e00d89ac892","resolution":{"observed_at":"2026-08-02T04:39:17.997808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:18.139932Z","title":"InICLR, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:18.139932Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:4b1c313812d62689a0fb489829eae46a87ce0ff73c4a96a333b3de7740afd5dc","observation_id":"2aa97b49-3c6b-4b1c-a28c-11f2077a03b6","resolution":{"observed_at":"2026-08-02T04:39:18.139932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03673","last_updated":"2025-06-05T23:45:32Z","snapshot_observed_at":"2026-07-06T21:19:49.709528Z","submitted_at":"2025-05-06T16:11:49Z","title":"RoboOS: A Hierarchical Embodied Framework for Cross-Embodiment and Multi-Agent Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03673","snapshot_observed_at":"2026-08-02T04:39:18.350739Z","title":"RoboOS: A hierarchical embodied framework for 56 cross-embodiment and multi-agent collaboration.arXiv preprint arXiv:2505.03673, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:18.350739Z"},"links":{"cited_paper":"/paper/2505.03673","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:8a2cd153930311478a5c1d09825add15ecd02978a8d579f17cc96feafec02782","observation_id":"cdd44bdc-0a77-4a81-9eca-f49d74359629","resolution":{"observed_at":"2026-08-02T04:39:18.350739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:18.469187Z","title":"Voyager: An open-ended embodied agent with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:18.469187Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:eda875deac7ee28aa49857bca2263df1882926de78040746fe021e9ed74acc88","observation_id":"7d2113f3-7c63-43b3-b129-6e1a179efa53","resolution":{"observed_at":"2026-08-02T04:39:18.469187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10943","last_updated":"2024-07-15T17:40:46Z","snapshot_observed_at":"2026-07-06T18:46:39.497352Z","submitted_at":"2024-07-15T17:40:46Z","title":"GRUtopia: Dream General Robots in a City at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10943","snapshot_observed_at":"2026-08-02T04:39:18.669698Z","title":"GRUtopia: Dream general robots in a city at scale.arXiv preprint arXiv:2407.10943, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:18.669698Z"},"links":{"cited_paper":"/paper/2407.10943","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:7fc33686bbe10aa5450330f5166dd3f06ec77c9b15ca4ac9fb59d1e6efc5449d","observation_id":"edcc21ea-2bef-41bc-bc7b-6cca50c03447","resolution":{"observed_at":"2026-08-02T04:39:18.669698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:18.787968Z","title":"World modeling makes a better planner: Dual preference optimization for embodied task planning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:18.787968Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:3cbde9264433ec0e50e6b32618421c9ebd4cc2abc2c0e2dd6e66cdb5aacf7bbf","observation_id":"5d349bd6-7162-4d26-8290-d7334be25ffb","resolution":{"observed_at":"2026-08-02T04:39:18.787968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:19.007987Z","title":"Communication-efficient desire alignment for embodied agent-human adaptation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.007987Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:3661512cb35536f436daa7c5abd126390b75b4dc149e31a7210692a9a7bfc6ce","observation_id":"ec354962-74c1-4ad2-a013-c6f1c9134615","resolution":{"observed_at":"2026-08-02T04:39:19.007987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-02T04:39:19.193430Z","title":"Set-of-mark promptingunleashesextraordinaryvisualgroundinginGPT-4V.arXivpreprintarXiv:2310.11441, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.193430Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:46110f33990b58a26bc0848879aafa3362e4d85f5b969c7e5f30eb83658e4c47","observation_id":"d5911648-d842-41c4-abba-ee10a9a71e08","resolution":{"observed_at":"2026-08-02T04:39:19.193430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:19.349658Z","title":"EmbodiedBench: Comprehensive benchmarking multi-modal large language models for vision- driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.349658Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:55ccb75d6d14bc7371a269e1a223713d7bbbd56d9c03b075da4f8ed02d59158e","observation_id":"d2318268-8d09-4f1e-aae9-15df79f04d6f","resolution":{"observed_at":"2026-08-02T04:39:19.349658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:19.500365Z","title":"Holodeck: Language guided generation of 3D embodied AI environments","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.500365Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:05314833889989a9b6f55f06578356220c4b5f71a12ad681790a86884ea99d76","observation_id":"2fee0115-afec-4ed2-a102-763c0cda56c1","resolution":{"observed_at":"2026-08-02T04:39:19.500365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.12533","last_updated":"2025-05-11T12:38:16Z","snapshot_observed_at":"2026-07-06T20:53:31.919637Z","submitted_at":"2025-03-16T14:53:53Z","title":"Being-0: A Humanoid Robotic Agent with Vision-Language Models and Modular Skills","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.12533","snapshot_observed_at":"2026-08-02T04:39:19.618044Z","title":"Being-0: A humanoid robotic agent with vision-language models and modular skills.arXiv preprint arXiv:2503.12533, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.618044Z"},"links":{"cited_paper":"/paper/2503.12533","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:73f6735248404ad15b94b8ccb9aa5bcc1b949ab7b978903c98ded17f1247f561","observation_id":"bd33c8f1-d2ac-4bb3-8eae-f6102bcd19b7","resolution":{"observed_at":"2026-08-02T04:39:19.618044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.18071","last_updated":"2025-07-28T11:11:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-24T03:50:32Z","title":"Group Sequence Policy Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.18071","snapshot_observed_at":"2026-08-02T04:39:19.749946Z","title":"Group sequence policy opti- mization.arXiv preprint arXiv:2507.18071, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.749946Z"},"links":{"cited_paper":"/paper/2507.18071","citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:f4cf39106151763ef894b807d1916a309594d79a0e42da58ee12d11a330d2c47","observation_id":"7662d4fb-edfc-4e54-a5f7-3b99f5a6ec23","resolution":{"observed_at":"2026-08-02T04:39:19.749946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T04:39:19.874610Z","title":"Sanketi, Grecia Salazar, Michael S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T04:39:19.874610Z"},"links":{"citing_paper":"/paper/2607.13653"},"observation_digest":"sha256:4142f74ce2f7eda3a5dfd3b32decc6383a4ea81627da60e3e4179bc1814c96b7","observation_id":"8a505edd-2a1f-41d9-bbfe-7f2bcb13574f","resolution":{"observed_at":"2026-08-02T04:39:19.874610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.13653","last_updated":"2026-07-27T04:02:35Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T04:39:09.172952Z","submitted_at":"2026-07-15T09:55:45Z","title":"Exploratory, Communicative, and Deployable: Vision-Driven Embodied Agents for Open-World Mobile Manipulation"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.13653."}