{"as_of":"2026-08-06T08:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4800101f435379f9ebb09e698c5176440d04e6143449df9d1708e0e1a464a099","coverage":[{"denominator":22,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":22,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T00:24:45.343430Z","state":"measured"},{"denominator":79,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":79,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":57,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:13:24.699600Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2504.19678","last_updated":"2026-03-06T19:01:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-28T11:08:22Z","title":"From LLM Reasoning to Autonomous AI Agents: A Comprehensive Review","version":2},"reference_index":124,"source":"pdf_text","source_observed_at":"2026-05-15T02:57:37.873567Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2504.19678"},"observation_digest":"sha256:f442c5d353cc61bf6d68dbb696be85ce4b3d209a7b0ab7f7b9135abe86e518d7","observation_id":"cd0faa7a-c349-44bf-baa1-866bfa5a84ca","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2506.02387","last_updated":"2026-04-13T08:26:12Z","snapshot_observed_at":"2026-08-04T07:16:14.991803Z","submitted_at":"2025-06-03T02:57:38Z","title":"VS-Bench: Evaluating VLMs for Strategic Abilities in Multi-Agent Environments","version":3},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-19T11:57:08.314088Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2506.02387"},"observation_digest":"sha256:8af3ab58a670bb87c0fa15d0e3a0e944a31d2e02263ea91481d77371eee79f32","observation_id":"1c01cf7b-0cb0-43b0-a351-1d7b11dc2069","resolution":{"observed_at":"2026-05-19T11:57:16.257323Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2507.21046","last_updated":"2026-01-16T20:59:08Z","snapshot_observed_at":"2026-08-01T06:32:44.461162Z","submitted_at":"2025-07-28T17:59:05Z","title":"A Survey of Self-Evolving Agents: What, When, How, and Where to Evolve on the Path to Artificial Super Intelligence","version":4},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-14T22:23:14.621091Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2507.21046"},"observation_digest":"sha256:3723604c19c5781b9fc6cdb3c8fd931ecb28dce0161078747e277d973068640b","observation_id":"2fbb1055-bac0-4de1-afab-f3b463cd6f0b","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-04T09:33:41.839773Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.14828","last_updated":"2026-06-09T15:51:56Z","snapshot_observed_at":"2026-08-05T04:35:32.361585Z","submitted_at":"2025-10-16T16:04:35Z","title":"RoboGPT-R1: Enhancing Robot Task Planning with Reinforcement Learning","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T09:33:41.839773Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2510.14828"},"observation_digest":"sha256:86a0bbfe167c819118916f43ba2b230653530f46c843865be8aa123958bff858","observation_id":"2ce6b19d-f7b0-40cc-bf15-783a3356c17d","resolution":{"observed_at":"2026-08-04T09:33:41.839773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:3c4afb6af6139e9cdfb6c3716cb1acd6c084e83787e1f8aed177f033a764637b","observation_id":"0c3c7d1d-2359-447e-acd6-b3946edd022e","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T21:14:11.784486Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.17649","last_updated":"2026-07-07T04:04:31Z","snapshot_observed_at":"2026-08-03T21:14:07.753245Z","submitted_at":"2025-11-20T09:52:20Z","title":"SWITCH: Benchmarking Modeling and Handling of Tangible Interfaces in Long-horizon Embodied Scenarios","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T21:14:11.784486Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.17649"},"observation_digest":"sha256:917df47ba53811ccc463f726586767a710a80b0ccdc00fd53cccf1c783f28d59","observation_id":"001bf018-0459-48d5-a0b6-fc31a33ace18","resolution":{"observed_at":"2026-08-03T21:14:11.784486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T20:42:56.921728Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.18685","last_updated":"2026-07-15T06:20:30Z","snapshot_observed_at":"2026-08-03T20:42:51.500216Z","submitted_at":"2025-11-24T02:02:29Z","title":"Beyond Description: Cognitively Benchmarking Fine-Grained Action for Embodied Agents","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T20:42:56.921728Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.18685"},"observation_digest":"sha256:7c0fac1183259077b8aed073dcef86f876bbcfc2661920634da333b18797b71e","observation_id":"e46753b1-8384-4fb1-8788-a17ba1a5348e","resolution":{"observed_at":"2026-08-03T20:42:56.921728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T20:15:35.989249Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2511.20644","last_updated":"2026-07-09T17:59:10Z","snapshot_observed_at":"2026-08-06T01:52:36.714650Z","submitted_at":"2025-11-25T18:59:02Z","title":"Vision-Language Memory for Spatial Reasoning","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T20:15:35.989249Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2511.20644"},"observation_digest":"sha256:dd6cf6210cbaa0bcae484d75726d65653f10c9056d21eaf81be99aef31616545","observation_id":"6c686cc6-2972-49c6-a179-b04d943a1882","resolution":{"observed_at":"2026-08-03T20:15:35.989249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T03:09:31.161760Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:64432c63148c597e97e320addbcfbfa14a36630f134c97eec55e6c953ce81c62","observation_id":"9c4ac8e5-6d71-49fb-a73a-d9d4a7249104","resolution":{"observed_at":"2026-05-17T03:11:29.855452Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T18:51:48.033515Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.03438","last_updated":"2026-07-30T22:27:17Z","snapshot_observed_at":"2026-08-05T23:09:55.506505Z","submitted_at":"2025-12-03T04:42:47Z","title":"Multimodal Reinforcement Learning with Adaptive Verifier for AI Agents","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-03T18:51:48.033515Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2512.03438"},"observation_digest":"sha256:105bc11683c029bd31509aad438705a1f1eeed300998ad2f9ffcfdf77eeba7ca","observation_id":"f552b55e-3a86-4cb2-9843-7e8bfaf3efeb","resolution":{"observed_at":"2026-08-03T18:51:48.033515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T13:29:51.752016Z","title":"Embod- iedbench: Comprehensive benchmarking multi-modal large lan- guage models for vision-driven embodied agents,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2512.24125","last_updated":"2026-07-26T09:02:49Z","snapshot_observed_at":"2026-08-04T11:27:48.952895Z","submitted_at":"2025-12-30T10:18:42Z","title":"Unified Embodied VLM Reasoning with Robotic Action via Autoregressive Discretized Pre-training","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T13:29:51.752016Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2512.24125"},"observation_digest":"sha256:b806fec6fe93a18afe3b805507a8ef951ea5497782a9bb0f496d5ffc0945c458","observation_id":"9718d69a-9d11-4238-a967-d9ec96a96563","resolution":{"observed_at":"2026-08-03T13:29:51.752016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2601.21692","last_updated":"2026-05-22T01:46:45Z","snapshot_observed_at":"2026-08-02T10:02:20.704165Z","submitted_at":"2026-01-29T13:26:29Z","title":"TCAP: Tri-Component Attention Profiling for Unsupervised Backdoor Detection in MLLM Fine-Tuning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-25T07:33:15.865358Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2601.21692"},"observation_digest":"sha256:3a863feebdb10cb2e80cf105bbf893222a877eccdfb55ec99c3d7b806bf82981","observation_id":"c503a699-ab9c-40d3-8e94-86609930ed8f","resolution":{"observed_at":"2026-05-25T07:35:28.658157Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T05:38:50.023173Z","title":"Embodiedbench: Comprehensive benchmarking multi- modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.01662","last_updated":"2026-05-31T01:44:31Z","snapshot_observed_at":"2026-08-04T04:26:21.121118Z","submitted_at":"2026-02-02T05:30:14Z","title":"PLanAR: Planning-Language-Grounded Agentic Reasoning for Robot Manipulation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T05:38:50.023173Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.01662"},"observation_digest":"sha256:a0612a68a14acfb9b7cca4bf1a230b475d9942cc7f0fa4ebb1bf5bf2ff1f20a7","observation_id":"96c42348-e4f9-4d2a-9dd5-373bf61df92a","resolution":{"observed_at":"2026-08-03T05:38:50.023173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2602.08392","last_updated":"2026-04-04T07:19:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-09T08:47:14Z","title":"ST-BiBench: Benchmarking Multi-Stream Multimodal Coordination in Bimanual Embodied Tasks for MLLMs","version":2},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-16T06:00:02.043029Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.08392"},"observation_digest":"sha256:eff6735b3dfcf3f7eb7bfe6ab9bcc4b1592737afefef775c79dbadd5bf56d918","observation_id":"134909e8-416c-4e2d-bab2-370b3069cce1","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-02T22:26:39.032152Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.16902","last_updated":"2026-05-30T16:45:37Z","snapshot_observed_at":"2026-08-06T05:35:47.226397Z","submitted_at":"2026-02-18T21:33:59Z","title":"LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?","version":4},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-02T22:26:39.032152Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.16902"},"observation_digest":"sha256:e4ee8e1a98ec255c9085771a7cb2977bfba5a88079b1046395c2818750deb502","observation_id":"0275c72d-a767-486b-becb-64c8b9991453","resolution":{"observed_at":"2026-08-02T22:26:39.032152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":2},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-15T20:12:46.385646Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:3cb53cdf069815b8999e69bb00e5cef5563aebb7edd5da2ab03a3d466d016493","observation_id":"b1c5c87f-0953-4960-91d0-503c13e898c5","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":3},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-05-22T10:30:06.829915Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:7ab86ac2398862c7cabd4ce1574e0630243655e00ea07931eed0d3c17e3cfc6e","observation_id":"cb1a712b-eeda-4722-a10e-094923d1432e","resolution":{"observed_at":"2026-05-22T10:31:25.382916Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-02T22:00:12.003747Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2602.18600","last_updated":"2026-07-29T09:42:45Z","snapshot_observed_at":"2026-08-02T22:00:02.664173Z","submitted_at":"2026-02-20T20:22:18Z","title":"MapTab: A Diagnostic Benchmark for Long-Horizon Multi-Criteria Multimodal Reasoning on Heterogeneous Topological Graphs","version":5},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-02T22:00:12.003747Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2602.18600"},"observation_digest":"sha256:c1fea51caa372684cfdbd3640b394caf08923c42b2aa8aa21112135b06ac46e9","observation_id":"e8579d2d-49ba-4eb7-b5a9-329f5edd818a","resolution":{"observed_at":"2026-08-02T22:00:12.003747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.07378","last_updated":"2026-04-08T01:34:05Z","snapshot_observed_at":"2026-08-02T17:51:27.457922Z","submitted_at":"2026-04-08T01:34:05Z","title":"Evaluation as Evolution: Transforming Adversarial Diffusion into Closed-Loop Curricula for Autonomous Vehicles","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T18:55:30.816224Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.07378"},"observation_digest":"sha256:3d8c3e334bc224c5ee1510bc3f9235c55d50629b8ad0b5708d52a6c0e177a84d","observation_id":"b79e4a07-6e16-4773-b3f8-617128355912","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.11411","last_updated":"2026-04-13T12:55:56Z","snapshot_observed_at":"2026-08-03T03:42:10.089825Z","submitted_at":"2026-04-13T12:55:56Z","title":"Online Reasoning Video Object Segmentation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T15:29:03.843441Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.11411"},"observation_digest":"sha256:57189369d50dee675f1424597e07a663c6399e5357691d32c2008e2088f3abbf","observation_id":"941cf336-ccfb-4be9-8e3c-6ccd52b2dcf8","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.13633","last_updated":"2026-04-15T09:01:20Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:01:20Z","title":"ESCAPE: Episodic Spatial Memory and Adaptive Execution Policy for Long-Horizon Mobile Manipulation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T13:09:32.132811Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.13633"},"observation_digest":"sha256:29aa6c005d1d19fc6844e699a1b7ff8ab979600436595618ae74660978c4974c","observation_id":"0c4c9b45-3d9f-4660-81e4-5f8065c3b317","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.14785","last_updated":"2026-04-22T14:57:48Z","snapshot_observed_at":"2026-07-06T23:02:27.141640Z","submitted_at":"2026-04-16T08:45:34Z","title":"MirrorBench: Evaluating Self-centric Intelligence in MLLMs by Introducing a Mirror","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T10:53:48.374637Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.14785"},"observation_digest":"sha256:edec43b61f611ace43f8ddd002de5313709b297aff9a7eb9b00478002e8d5ac1","observation_id":"e4e02e69-4502-4cd0-a939-dcc4063492cc","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.16331","last_updated":"2026-03-12T17:54:42Z","snapshot_observed_at":"2026-07-06T23:03:39.351412Z","submitted_at":"2026-03-12T17:54:42Z","title":"BrainMem: Brain-Inspired Evolving Memory for Embodied Agent Task Planning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-15T11:52:58.630590Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.16331"},"observation_digest":"sha256:48f2163a4832271c64676557d4800b082b5af464a8180164f909e4b24ed9731a","observation_id":"9f71d0a8-205d-4d73-b998-9c77e60e71ee","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.16886","last_updated":"2026-04-18T07:26:24Z","snapshot_observed_at":"2026-07-06T23:04:05.813982Z","submitted_at":"2026-04-18T07:26:24Z","title":"Chain Of Interaction Benchmark (COIN): When Reasoning meets Embodied Interaction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T06:50:09.031009Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.16886"},"observation_digest":"sha256:8b4a34f5ad2c1870e8b1c6b53dae6304ebd0d2e239cac47d6f4e9d62275502aa","observation_id":"a29bcb38-f12a-4216-bd2c-f3aeee16f432","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.17241","last_updated":"2026-04-19T04:04:02Z","snapshot_observed_at":"2026-07-06T23:04:23.730478Z","submitted_at":"2026-04-19T04:04:02Z","title":"GaLa: Hypergraph-Guided Visual Language Models for Procedural Planning","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T06:26:06.208036Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.17241"},"observation_digest":"sha256:321a504a8b163cfd10f7395434d5a62ba26d29099bc78286382c25db2a552d4c","observation_id":"eac2dfab-431f-4838-84c8-48b4b5a2c81f","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2604.19839","last_updated":"2026-04-21T09:11:00Z","snapshot_observed_at":"2026-07-06T23:06:26.596990Z","submitted_at":"2026-04-21T09:11:00Z","title":"Environmental Understanding Vision-Language Model for Embodied Agent","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T03:36:52.685696Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2604.19839"},"observation_digest":"sha256:656c43f8818bdea35df803aeab2a44b9dac6860945ccb1bc6d1001e4c41df671","observation_id":"55884cfe-fbf7-41af-a01c-d9a6181c63f4","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-08T10:12:58.421050Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:e8f4357343ab9f960bf8b0139369316dd80f61a57033fc337c48f9f86c621a67","observation_id":"3389aba7-1e28-4e1d-aac3-d84a8eb2fd1f","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.06230","last_updated":"2026-05-08T02:31:22Z","snapshot_observed_at":"2026-08-04T18:06:27.816136Z","submitted_at":"2026-05-07T13:21:15Z","title":"Safactory: A Scalable Agentic Infrastructure for Training Trustworthy Autonomous Intelligence","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-11T00:56:48.838028Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.06230"},"observation_digest":"sha256:95b979d92bdfc3bdd5058e6a0f37ebb3a832430a194741c8ef74ae1dad344f6f","observation_id":"2437dcb2-8887-46af-a3ac-3b02cdb6aefd","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.07594","last_updated":"2026-05-14T02:47:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T11:07:04Z","title":"MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-11T02:36:53.775557Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.07594"},"observation_digest":"sha256:5604504949e9c8aa67a7450fb0b24e0d95a60b2b533399767eeb730e81e34b20","observation_id":"5e155ef8-cdd4-4b86-8fb9-022f5a54d294","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.07594","last_updated":"2026-05-14T02:47:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-08T11:07:04Z","title":"MemCompiler: Compile, Don't Inject -- State-Conditioned Memory for Embodied Agents","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-15T05:57:05.259111Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.07594"},"observation_digest":"sha256:b8119c0d281abfc48328396e9ea186ed69baf738c70ca1586a36142ab44a0672","observation_id":"b37b9033-653c-4d26-b790-b11e552c08be","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T01:23:37.488121Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.08747"},"observation_digest":"sha256:1a2a336066ed9b8c74281911b2eca7893dbb1eaf7446ec058b5550141d678c0f","observation_id":"0246b88a-f056-425e-9c3f-0ac5c4bef107","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:03:30.995808Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.08747"},"observation_digest":"sha256:c36741b1dd2f96878f0d4590d784f53bc3254fe40b98c37a66f6853340f3d710","observation_id":"3bfa3d12-6d43-4469-bee3-b4bd9c966058","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.08747","last_updated":"2026-05-14T03:36:04Z","snapshot_observed_at":"2026-07-06T23:20:57.084438Z","submitted_at":"2026-05-09T07:24:07Z","title":"Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T06:25:15.510083Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.08747"},"observation_digest":"sha256:781ecb71d639443c0b434688cc5c9c67e8cab5f96f9939dfdad8a4f00723f3f9","observation_id":"6ae12fb6-355e-4744-98df-f7c72b39cc31","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.14704","last_updated":"2026-05-14T11:21:41Z","snapshot_observed_at":"2026-07-06T23:26:04.286377Z","submitted_at":"2026-05-14T11:21:41Z","title":"SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-15T05:03:54.408677Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.14704"},"observation_digest":"sha256:f296be10f99d4d6710ba7e84b5ff6756f102974212e506b8275921c5e59bfc68","observation_id":"33fd9655-e68a-4a65-b101-b72f71d2bb8b","resolution":{"observed_at":"2026-05-17T00:24:45.426358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.17776","last_updated":"2026-05-20T07:06:32Z","snapshot_observed_at":"2026-07-31T09:47:00.634742Z","submitted_at":"2026-05-18T02:49:58Z","title":"CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-20T11:18:31.696442Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.17776"},"observation_digest":"sha256:d4a8a66953b5e7ca54cb999ad3310d3f8a155c63718318f3861f6dea6862fd3c","observation_id":"3bfad6e8-56bb-4bb2-8fa6-a580031e4416","resolution":{"observed_at":"2026-05-20T11:23:14.211508Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.17776","last_updated":"2026-05-20T07:06:32Z","snapshot_observed_at":"2026-07-31T09:47:00.634742Z","submitted_at":"2026-05-18T02:49:58Z","title":"CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-21T09:00:46.267463Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.17776"},"observation_digest":"sha256:14e5d3d614bff1b2b1c7ac1f382e46898d3c11bc683ceb2ad43006c2ffa7d4bc","observation_id":"0617a6c1-888f-49ab-9de0-57633cbab29f","resolution":{"observed_at":"2026-05-21T09:04:04.596726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.17933","last_updated":"2026-05-18T06:41:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-18T06:41:14Z","title":"AtlasVA: Self-Evolving Visual Skill Memory for Teacher-Free VLM Agents","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-20T11:24:48.558423Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.17933"},"observation_digest":"sha256:e26dabaefb5d938486562ac3eb8ad5920e180ed12026af1860b69551863a9d10","observation_id":"ea6908c6-e8a1-42ca-b176-5751481be93c","resolution":{"observed_at":"2026-05-20T11:28:14.479443Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.18727","last_updated":"2026-05-18T17:51:34Z","snapshot_observed_at":"2026-07-06T23:29:33.702647Z","submitted_at":"2026-05-18T17:51:34Z","title":"DexHoldem: Playing Texas Hold'em with Dexterous Embodied System","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-20T09:38:43.801252Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.18727"},"observation_digest":"sha256:f6b6b33f4c8bb2162c5b4e1c9a94a3c7791131f5df26966af08a2ce322465292","observation_id":"2bed4e9a-b408-4a18-bcde-da92fcdf242c","resolution":{"observed_at":"2026-05-20T09:43:11.119191Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2605.29341","last_updated":"2026-06-01T07:01:55Z","snapshot_observed_at":"2026-07-06T23:38:46.361360Z","submitted_at":"2026-05-28T04:27:20Z","title":"WorldMemArena: Evaluating Multimodal Agent Memory Through Action-World Interaction","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-29T08:33:38.011236Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2605.29341"},"observation_digest":"sha256:a4c982b529ecc05fb2ce782ba8df4304fdee5fd6a1c47b9ec5b7cbc5aa04561f","observation_id":"572d38ee-4d2e-4dab-97d9-c762949e15f2","resolution":{"observed_at":"2026-06-29T08:53:16.490784Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.02031","last_updated":"2026-06-04T09:03:30Z","snapshot_observed_at":"2026-08-03T02:24:10.083746Z","submitted_at":"2026-06-01T10:20:10Z","title":"OpenWebRL: Demystifying Online Multi-turn Reinforcement Learning for Visual Web Agents","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T15:46:50.587684Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.02031"},"observation_digest":"sha256:21ca3c81379a8df03a30d4bab3483d70e8499182f7d2b7abea201991e93f05ec","observation_id":"e4c219b1-1b7e-43f8-8449-93a2d4a6f311","resolution":{"observed_at":"2026-07-01T22:06:16.401189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.07602","last_updated":"2026-05-29T09:31:25Z","snapshot_observed_at":"2026-07-06T23:47:15.041928Z","submitted_at":"2026-05-29T09:31:25Z","title":"Sample-Efficient Post-Training for LEGO Spatial-Physics Reasoning","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-28T23:38:38.127345Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.07602"},"observation_digest":"sha256:9dec45240c8a7f100697ddc69c5cac589b97217f6f377d99156e6f1104ad038f","observation_id":"45dda8e8-3acf-491b-b450-a7a1226d1c4c","resolution":{"observed_at":"2026-06-28T23:42:49.557377Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.07962","last_updated":"2026-06-06T03:40:47Z","snapshot_observed_at":"2026-07-31T20:27:39.414307Z","submitted_at":"2026-06-06T03:40:47Z","title":"ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-27T20:23:18.667677Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.07962"},"observation_digest":"sha256:79135f1efb5d38e1b89d16676ca86da3e8104c639f66e56543e23a19dcfd362a","observation_id":"5541e0bd-d6fb-49d9-9bbf-de7e114fb2f1","resolution":{"observed_at":"2026-07-02T20:27:22.654943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.09669","last_updated":"2026-06-08T15:51:51Z","snapshot_observed_at":"2026-08-02T20:17:41.727375Z","submitted_at":"2026-06-08T15:51:51Z","title":"SpatialWorld: Benchmarking Interactive Spatial Reasoning of Multimodal Agents in Real-World Tasks","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-27T16:35:14.099586Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.09669"},"observation_digest":"sha256:c6c5b15dd22fb690cb23a3fd06c8426a5bcd3ebc02aae0f8cba9463bb4f8ca3a","observation_id":"e4bdfe65-5a21-4455-9f69-007194d073a2","resolution":{"observed_at":"2026-07-03T01:27:30.613186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.11909","last_updated":"2026-06-10T10:37:27Z","snapshot_observed_at":"2026-07-06T23:50:53.469137Z","submitted_at":"2026-06-10T10:37:27Z","title":"Embodied-BenchClaw: An Autonomous Multi-Agent System for Embodied Spatial Intelligence Benchmark Construction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-27T09:48:49.786021Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.11909"},"observation_digest":"sha256:70311b2de5c926263471a05a07fd65d75e19a0f41692f152b13de63aad2b26e2","observation_id":"5fba39a7-eb8e-43a2-9743-d7a4f974a161","resolution":{"observed_at":"2026-07-03T10:48:02.874775Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.12195","last_updated":"2026-06-10T15:17:08Z","snapshot_observed_at":"2026-08-01T02:09:41.655807Z","submitted_at":"2026-06-10T15:17:08Z","title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","version":1},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-06-27T09:48:27.652901Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.12195"},"observation_digest":"sha256:cc7b87375779fc2ca72ddab180829142a9b747b23685fe4c11f4a228ee33258e","observation_id":"77b3e495-0d87-411f-a1c9-1adb18b4b53b","resolution":{"observed_at":"2026-07-03T10:48:03.120025Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.12207","last_updated":"2026-06-10T15:25:02Z","snapshot_observed_at":"2026-08-05T04:33:21.566287Z","submitted_at":"2026-06-10T15:25:02Z","title":"Intelligent Automation for Embodied Benchmark Construction: Pipelines, Embodiments, Simulators, and Trends","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-27T09:17:50.473747Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.12207"},"observation_digest":"sha256:dc5f98f35b2dd9c673f5e4fa69893617dae4929a050117b8a7d93e85d1ade6cc","observation_id":"d6be2457-669e-4684-8a08-77c73f53f3e0","resolution":{"observed_at":"2026-07-03T11:58:05.940585Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.20479","last_updated":"2026-06-18T16:56:20Z","snapshot_observed_at":"2026-07-06T23:55:38.979306Z","submitted_at":"2026-06-18T16:56:20Z","title":"GroundControl: Anticipating Navigation Failures in Vision-Language Agents via Trajectory-Consistent Uncertainty Estimates","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T17:13:47.070153Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.20479"},"observation_digest":"sha256:674f9cb6fab4934a33441e07db968ddd99b58f26dccd55e41fd5f0010102e9c8","observation_id":"e5c0c01f-3b83-4292-8ff4-68cc6d9a4205","resolution":{"observed_at":"2026-07-04T04:09:34.272698Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2606.31073","last_updated":"2026-06-30T03:02:12Z","snapshot_observed_at":"2026-07-07T00:04:48.748126Z","submitted_at":"2026-06-30T03:02:12Z","title":"MultiUAV-Plat: An LLM-Oriented Platform, Benchmark and Framework for Multi-UAV Collaborative Task Planning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-01T06:09:22.431356Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2606.31073"},"observation_digest":"sha256:6b8d80c3f39fcbb307cffcb37fbc7721c695c37c6ec0aa3281015150f3522706","observation_id":"f773a281-2f9c-4f7e-a320-495ce06fbbb2","resolution":{"observed_at":"2026-07-01T06:15:26.578752Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2607.00457","last_updated":"2026-07-01T05:23:56Z","snapshot_observed_at":"2026-07-07T00:06:09.887791Z","submitted_at":"2026-07-01T05:23:56Z","title":"Multi-scale Mixture of World Models for Embodied Agents in Evolving Environments","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-02T13:01:58.866764Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.00457"},"observation_digest":"sha256:9545cf236c27b5cee372b7c67b69cbab9449a524cc38f6b2d5bb15734cce04dc","observation_id":"dbb92018-0b8a-4cb0-8eed-9f322a2f62f9","resolution":{"observed_at":"2026-07-02T13:06:58.502976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":"2502.09560","doi":"10.48550/arxiv.2502.09560","metadata_source":"pith","pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","venue":"cs.AI","work_id":"b1e694c6-fe5b-477f-ab8f-801e0fb0412f","year":2025},"citing_paper":{"arxiv_id":"2607.06157","last_updated":"2026-07-07T11:34:10Z","snapshot_observed_at":"2026-07-10T23:18:21.284815Z","submitted_at":"2026-07-07T11:34:10Z","title":"LLM Agents for Deliberative Collaboration: A Study on Joint Decision Making Under Partial Observability","version":1},"reference_index":174,"source":"arxiv_source","source_observed_at":"2026-07-08T15:03:14.483228Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.06157"},"observation_digest":"sha256:4ff195595496a9ee638d960eb465f95b4f40e42a987cc12ba9226f62e0037f7b","observation_id":"ed3391f0-0627-4f70-ab1b-fd1ab6c758c0","resolution":{"observed_at":"2026-07-08T15:05:03.545431Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-07-14T01:10:44.920887Z","title":"Yang, J., Jimenez, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09996","last_updated":"2026-07-10T21:45:16Z","snapshot_observed_at":"2026-08-02T05:16:19.119920Z","submitted_at":"2026-07-10T21:45:16Z","title":"Who&When Pro: Can LLMs Really Attribute Failures in AI Agents?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T01:10:44.920887Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.09996"},"observation_digest":"sha256:82665c8d2df2ce63ebd72b633910b8a278764ddd2a16e1c11cd426b419c6e052","observation_id":"5b528198-cced-4cf0-9480-ec9bea17795a","resolution":{"observed_at":"2026-07-14T01:10:44.920887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-07-14T12:26:27.446079Z","title":"EmbodiedBench: Comprehensive benchmarking multi-modal large language models for vision- driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":1},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-07-14T12:26:27.446079Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:b8221df4ef1dc24545b698c7c5cbc3da0ecda0e44e9f4312cc03d509274d0371","observation_id":"f0de9766-8888-461b-9763-29a1d24acac7","resolution":{"observed_at":"2026-07-14T12:26:27.446079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-02T07:21:35.065643Z","title":"EmbodiedBench: Comprehensive benchmarking multi-modal large language models for vision- driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10350","last_updated":"2026-07-17T17:27:03Z","snapshot_observed_at":"2026-08-02T07:21:21.791047Z","submitted_at":"2026-07-11T15:24:43Z","title":"ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory","version":3},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-08-02T07:21:35.065643Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.10350"},"observation_digest":"sha256:cbe36252987841510b36276ee879d680dfebaa31643950abd9e3c0df6f24f4a0","observation_id":"8e922246-0a77-497f-8128-b5740718dd89","resolution":{"observed_at":"2026-08-02T07:21:35.065643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-07-31T00:46:12.910645Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents.arXiv preprint arXiv:2502.09560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.27443","last_updated":"2026-07-29T20:14:43Z","snapshot_observed_at":"2026-08-06T07:25:46.863771Z","submitted_at":"2026-07-29T20:14:43Z","title":"Leveraging Trajectory Graphs for Pre-Execution Error Diagnosis in Agentic LLM Systems","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-31T00:46:12.910645Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.27443"},"observation_digest":"sha256:80fe0aac5f60374a8b381156398a73afb57508a059e980a0ff35fd5892540142","observation_id":"44386acd-0f27-472c-9eb1-2b18717fd673","resolution":{"observed_at":"2026-07-31T00:46:12.910645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-03T16:20:30.506056Z","title":"arXiv preprint arXiv:2502.09560 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28969","last_updated":"2026-07-31T02:45:56Z","snapshot_observed_at":"2026-08-05T23:12:11.614780Z","submitted_at":"2026-07-31T02:45:56Z","title":"SafeNexus: Discovering and Steering Modality-Universal Safety Neurons in MLLMs","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T16:20:30.506056Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2607.28969"},"observation_digest":"sha256:ba380d0ef91583a3ed231a58dc580b7c63c9cfafc2ebbbea2aa7ad6e9ede3406","observation_id":"437c2389-511d-4f3b-ada4-e114328adeaa","resolution":{"observed_at":"2026-08-03T16:20:30.506056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-06T00:13:24.699600Z","title":"Embodiedbench: Comprehensive benchmarking multi-modal large language models for vision-driven embodied agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01456","last_updated":"2026-08-02T19:29:48Z","snapshot_observed_at":"2026-08-06T08:17:57.505142Z","submitted_at":"2026-08-02T19:29:48Z","title":"Long-Horizon Embodied Decision-Making via Multimodal Memory Compression","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-06T00:13:24.699600Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2608.01456"},"observation_digest":"sha256:88a0f33350e532a900ded858dc5a4383a73183c0d36246fd031ea6c86eae7168","observation_id":"ac8bf5ec-4b22-432b-bf15-3e24b956d6e0","resolution":{"observed_at":"2026-08-06T00:13:24.699600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09560","snapshot_observed_at":"2026-08-05T15:25:39.444096Z","title":"doi:10.48550/arXiv.2502.09560 , abstract =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.03644","last_updated":"2026-08-04T13:29:00Z","snapshot_observed_at":"2026-08-06T07:22:27.908752Z","submitted_at":"2026-08-04T13:29:00Z","title":"Is Inter-Seed Cross-Play Enough? Evaluating the Robustness of Zero-Shot Coordination Algorithms to Implementation Details","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:39.444096Z"},"links":{"cited_paper":"/paper/2502.09560","citing_paper":"/paper/2608.03644"},"observation_digest":"sha256:5cf43e5dd76b3c64591a66161ccf6df6c3e2ddaaa5ae6fdfe1f4446a849bb49b","observation_id":"69fb0e21-b44b-4472-ac1b-fd15c76213df","resolution":{"observed_at":"2026-08-05T15:25:39.444096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.09560/citation-record","integrity":"/paper/2502.09560/integrity","json":"/paper/2502.09560/citation-record.json","paper":"/paper/2502.09560"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.24963/ijcai.2024/15","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Put washed lettuce in the refrigerator","venue":null,"work_id":"8a8d949d-2daa-4325-9b00-2d5fadb84f24","year":2015},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:e040cb0617e0a05100c74dab329376f0cad805ef5c9b2011685a60d85f9a92f2","observation_id":"077f13c7-f4f6-4281-9a93-74407eed553e","resolution":{"observed_at":"2026-05-17T00:24:45.369129Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"27f6b323-77d3-4db3-8a1a-0133d997f45e","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:02c111c96afeba98bb2ab5f4df3667764392fd1abb53676784e6bfc13242b359","observation_id":"83542d9a-a771-4696-8036-4bc678362fac","resolution":{"observed_at":"2026-05-17T00:24:45.372187Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Avoid performing actions that do not meet the defined validity criteria","venue":null,"work_id":"e891d1fa-8be9-43c7-b502-497cd9c17bb7","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:93105c9a0429ddae9d4cfe602e3a5703364b2a8f0506395d468d417f1f14b7fa","observation_id":"5e3f3d06-7814-40bf-8c03-e2845c01765d","resolution":{"observed_at":"2026-05-17T00:24:45.375431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You can explore these instances if you do not find the desired object in the current receptacle","venue":null,"work_id":"fd9c53ba-b5d9-4cb8-b73f-c6443a7c9b8a","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:3a04de710647cc83a39e3e7f8f02b5d83158ef84185bffbf466d692fc38a7717","observation_id":"35028448-e93f-4a45-8109-acf312d1bafe","resolution":{"observed_at":"2026-05-17T00:24:45.378460Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If the last action is invalid, reflect on the reason, such as not adhering to action rules or missing preliminary actions, and adjust your plan accordingly","venue":null,"work_id":"96cd5e15-7387-45f4-8068-6e674c6a1dcb","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:a03346c16fabf289d5df278b70c63e256e22582d49185d1c233d650e829b18ae","observation_id":"797cd098-8497-4ada-862e-56bd9744abb0","resolution":{"observed_at":"2026-05-17T00:24:45.381475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Each plan should include no more than 20 actions","venue":null,"work_id":"7145760e-59f1-4547-abaa-30d8814dc957","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:37d2bad12ae246272488a0e184b4651c373bd89c03840567a695c32a0b06e30f","observation_id":"71e67403-b852-4a13-97c4-542ec1991b58","resolution":{"observed_at":"2026-05-17T00:24:45.384181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7fce6a28-8f6a-4af7-a1e6-d27f08de1bb4","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:ee87d58e7c589d955bf274392cb35bc00a2e2858bdfa04234f1bedecaaa4d42d","observation_id":"977209b6-ef16-472f-8278-f2a71daa2f90","resolution":{"observed_at":"2026-05-17T00:24:45.386905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Avoid performing actions that do not meet the defined validity criteria","venue":null,"work_id":"6a100b7a-84dd-44ff-b347-bfd35d3053d0","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:8fbe53281312b175e00b638d3dff890359b40a2d257f65181e574cee200dd9f8","observation_id":"dee88191-3283-4676-a5c7-88ac72b6fe26","resolution":{"observed_at":"2026-05-17T00:24:45.389411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Try to modify the action sequence because previous actions do not lead to success","venue":null,"work_id":"04ed5eb9-6c86-47ce-b710-16bb2747d172","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:8501844c87c9b5a77e9f8c2860c17a4db35ce7c72049a2475e78ecd16d9c2965","observation_id":"36546a12-1133-4870-ac32-3cb138ea2feb","resolution":{"observed_at":"2026-05-17T00:24:45.392036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"You can explore these instances if you do not find the desired object in the current receptacle","venue":null,"work_id":"ee02e6ec-702b-40e9-b7ea-331f4ad8236a","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:0c90b4cf56dc2ca10673702417e2729bfc6a2e74169b08da7407bce10b6761b8","observation_id":"299b9357-228e-485f-b20b-91522f8445d7","resolution":{"observed_at":"2026-05-17T00:24:45.394687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If the last action is invalid, reflect on the reason, such as not adhering to action rules or missing preliminary actions, and adjust your plan accordingly","venue":null,"work_id":"24f0a907-a98b-4edf-be60-5f4f4ca03d21","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:c10d2992c3fc28815fb09d899ac5f48ea21ff83cb687cd31dea7c664093116ab","observation_id":"403ea813-25c6-4af7-9e4d-837180734fce","resolution":{"observed_at":"2026-05-17T00:24:45.397482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"try to be as close as possible","venue":null,"work_id":"47d7dc8e-e0a3-4fc9-b584-17037a366bfb","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:d4eb7a35c5c070e47c7ddcbef1b33a3f1bfd83b07145105864567d5ac9be0dfd","observation_id":"72382bf5-739c-46d4-a07b-a06d9db221e9","resolution":{"observed_at":"2026-05-17T00:24:45.399850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"on the front left side, a few steps from the current standing point)","venue":null,"work_id":"e2a21bc9-7831-44b7-a033-38343e70fce6","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:803231dac9c63ec59eba510d7aa3e8f7f3e337174d8f766e7a6264d72c3e0399","observation_id":"7350b6a4-db4a-4193-9f47-bf12a4df4cdd","resolution":{"observed_at":"2026-05-17T00:24:45.402302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"When planning for movement, reason based on target object’s location and obstacles around you","venue":null,"work_id":"427ce643-0f4e-4d52-a169-eba13bd3f8a6","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:a0239a0b6228a065ee650429ab8d51afcf4cb53459a9ef9ab3ee01b4d9074698","observation_id":"b5693947-0715-44f1-8fc4-047add080fa7","resolution":{"observed_at":"2026-05-17T00:24:45.404755Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"In other words, do not overly focus on correcting invalid actions when direct movement toward the target object can still bring you closer","venue":null,"work_id":"b2e305f3-82bc-46ae-a6a2-a1a9999cf530","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:57063637dfc06eb947a494dd8bddeb9e49b58696e117fc89034e70ee41cb122a","observation_id":"aa04e17b-1ded-4bf1-9cd1-2f1961248a69","resolution":{"observed_at":"2026-05-17T00:24:45.407479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"If so, plan nothing but ONE ROTATION at a step until that object appears in your view","venue":null,"work_id":"87baf053-1268-429b-beac-733d9f6222c9","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:64ac53eefe440ea14d9c491349946e2b3972ed5f0499ad86dcd8e50a6d9291ef","observation_id":"72944b41-f8aa-43b6-9ec0-a8cb8d3cadc9","resolution":{"observed_at":"2026-05-17T00:24:45.410831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"red\", \"maroon","venue":null,"work_id":"eead0ec8-dee0-4083-8585-fccac1b967f8","year":2023},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:e1a0904ff0b161fa39ea93e1b254740f14920a6f4fc9ec1a64f8588c6b9ae673","observation_id":"40c206ad-1f5e-46a5-9c25-0ff9c6852f30","resolution":{"observed_at":"2026-05-17T00:24:45.413310Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"There are two copper-colored pots visible on the stovetop","venue":null,"work_id":"af999c92-34b6-4b6a-af70-b30afcd1f1f3","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:37d9aa44df891093fc357a482cfb685968333c09def7dd17fe545f51bab99b4e","observation_id":"8097f701-ec5a-42d1-9348-8ca586228f76","resolution":{"observed_at":"2026-05-17T00:24:45.415740Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"pick up the spoon3","venue":null,"work_id":"0dbdf966-9fdf-4cdc-9a06-4ce12443cbd6","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:a6c702e5e6ab4d4054ac93a9f0b4eaba0d032602737db55ca1e7ff0f7520945f","observation_id":"a08ff14e-16e8-4dae-b047-36d8e03a1dc4","resolution":{"observed_at":"2026-05-17T00:24:45.418183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"pick up the sponge9","venue":null,"work_id":"6e7cd574-0978-4ff6-9f4a-a237706da5be","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:eba56c1638588f6df6c7bebd85bb80b9fd5df245065203bd413de85229b4ad33","observation_id":"acb841d4-5da2-4479-b6ed-3428036d8655","resolution":{"observed_at":"2026-05-17T00:24:45.420522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"action_id","venue":null,"work_id":"d0ccf722-0c42-4521-b956-356f953cb11b","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:206c23bdadf586f1c6d0f14c55bff6a141b3e34bb3800108a2c32b8d5988f847","observation_id":"9d54dd95-e210-44a7-81ba-c1d0bcfb4efb","resolution":{"observed_at":"2026-05-17T00:24:45.423186Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rotate to the left by 90 degrees18","venue":null,"work_id":"881dfa22-bdce-46c3-a942-6afc55d1904a","year":null},"citing_paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-17T00:24:45.343430Z"},"links":{"citing_paper":"/paper/2502.09560"},"observation_digest":"sha256:41236f1fd5bfbff06ac8b24db8ad2dc67ba7522ff434cbe2165056bba0c9c813","observation_id":"7cc72fbe-ec6d-4038-8692-4a40cfdd318f","resolution":{"observed_at":"2026-05-17T00:24:45.425569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.09560","last_updated":"2025-06-05T07:22:50Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T20:36:12.548343Z","submitted_at":"2025-02-13T18:11:34Z","title":"EmbodiedBench: Comprehensive Benchmarking Multi-modal Large Language Models for Vision-Driven Embodied Agents"},"reference_resolution":{"displayed":22,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":2,"verified_exact":1,"verified_fuzzy":18},"total_outbound_references":22},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 22 of 22 outbound references and 57 inbound Pith citation observations for arXiv:2502.09560."}