{"as_of":"2026-08-10T21:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:96be3a5242bf0f222bd56f9e5c2dc757d5fc215229f83db3e0e291f02d21b6c7","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T13:42:23.610697Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.10180/citation-record","integrity":"/paper/2607.10180/integrity","json":"/paper/2607.10180/citation-record.json","paper":"/paper/2607.10180"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Aligning cyber space with physical world: A comprehensive survey on embodied ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:50c197966a2d9a657f8bffece53725d5b7dd3a0f79af06eb276922126be30ea4","observation_id":"f00c4257-91e6-46ae-bb25-de4c7e84348c","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Ddl: Empowering delivery drones with large-scale urban sensing capability.IEEE Journal of Selected Topics in Signal Processing, 18(3):502–515, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:ac5d7b3a3043f8f61e30b7df86c0e1c35dbaacd0d9ac29f35e1624fe6babce3a","observation_id":"9200a22a-4381-4d04-8b34-4afd6d7ce9d0","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Fuel: Fast uav exploration using incremental frontier structure and hierarchical planning.IEEE Robotics and Automation Letters, 6(2):779–786, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:e94adb2afeba03a71d68017a3b8d324b9b074798577d9db74e8a702c3365e696","observation_id":"547f3c93-5a03-4a3c-aac0-47544564329c","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Ego-planner: An esdf-free gradient-based local planner for quadrotors.IEEE Robotics and Automation Letters, 6(2):478– 485, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:80438437ab06829b8a7e11ef78aa677c68ad480f5766821e4f694f593e9acb03","observation_id":"e13a3d2d-8593-4683-a351-ac65bbb41660","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Aerialvln: Vision-and-language navigation for uavs","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:5028fddd49abea9eea4b5aaafa5d67ce5fad87b485d09a722fc8bf59fe90e648","observation_id":"dff14024-bfe9-4f25-a69f-cdb83ac2be15","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07087","last_updated":"2024-10-10T05:02:04Z","snapshot_observed_at":"2026-08-10T19:28:41.701196Z","submitted_at":"2024-10-09T17:29:01Z","title":"Towards Realistic UAV Vision-Language Navigation: Platform, Benchmark, and Methodology","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07087","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Towards realistic UA V vision-language navigation: Platform, benchmark, and methodology.CoRR, abs/2410.07087, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2410.07087","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:177a847a1519fe1e09f80cd12641156a598ae89e9fbc0883d3df97d306e64834","observation_id":"74a76656-a27f-401c-96bc-8da10dbba011","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Openfly: A comprehensive platform for aerial vision-language navigation.arXiv preprint arXiv:2502.18041, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:2cfc67a83cbd44860b74bbd911ba06dcfd63c4d28d0070fea634a0e3432b0528","observation_id":"47f7d489-7a66-4a25-94a4-6e9bca05a0b5","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Citynav: A large-scale dataset for real-world aerial navigation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:4f06baeaf404cb747363532ce63a792c7ac4263e09e91374697ddda05bc14d9b","observation_id":"4230cabf-d3a5-4dd9-a646-1909da6f644e","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Openvln: Open- world aerial vision-language navigation.arXiv preprint arXiv:2511.06182, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:5f773b9b41b24ad39bc5eca6f576fd646842c1dcaad134e6aead31da8d6edd47","observation_id":"840fb07e-d0d3-4843-83bc-825b561e7249","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Reid, Stephen Gould, and Anton van den Hengel","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:1474d87bcdb54ea0707384dd2656bc8cab35041d330f047758eb801661b3083b","observation_id":"e19b2945-867c-453f-a730-3a794963ae41","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:6861e68676aefd4937cf97da8c7cba9f838a7214c070b7e4ef90b0b4fea68c83","observation_id":"6efb9a2a-48e0-4dd6-89e0-75c9ec2e3ba0","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Touchdown: Natural language navigation and spatial reasoning in visual street environments","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:b5b1e60cdc4515a14f0a6558148fceae5dcff403641e0a4de4c0ade47bba731c","observation_id":"b8af8378-b349-40b9-87c6-e063c968ea83","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Room-across- room: Multilingual vision-and-language navigation with dense spatiotemporal grounding","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:fd388ca3c16c6f9635abbfafa2537cd2b9ffe39b6fa5d3b00cc8fa6ee3706cab","observation_id":"af9d2155-68a6-42d4-876d-641a07f8dc9e","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Embodied question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:2b86a78fc8b70d7c0c864509ba704f03d28d0590bf5eae2a02036096eeaf5511","observation_id":"3d4602da-e8a7-40a3-8219-5d4097fbf594","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Eqa-mx: Embodied question answering using multimodal expression","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:8675f1d6df8d2426e79f53e8284f70125e4e59701008719325046185c9866ed7","observation_id":"3cc91ddb-a1fc-4936-91d4-d141901c0aa0","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Embodied Question Answering in photorealistic environments with point cloud perception","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:b9e303ee539bac94ee5b5a2c408c7475140586e05029a0a45c19524b94b442c1","observation_id":"1b4b831e-eba6-474a-8850-5eefb62f48d6","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12532","last_updated":"2025-05-22T00:44:13Z","snapshot_observed_at":"2026-08-10T05:29:12.361885Z","submitted_at":"2025-02-18T04:36:15Z","title":"CityEQA: A Hierarchical LLM Agent on Embodied Question Answering Benchmark in City Space","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12532","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"CityEQA: A hierarchical llm agent on embodied question answering benchmark in city space.arXiv preprint arXiv:2502.12532, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2502.12532","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:919d45a96d7653967c5271669b76985f5fb38d72bad67f206c9d1a1b0a2ce979","observation_id":"b1809335-af29-4212-ad7b-c7669eac7e15","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Explore until confident: Efficient exploration for embodied question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:016d5f80982276439ea34ad070b6b465bb7a5d6cacba127e7e6fb8c6a5739bc4","observation_id":"8d724d90-85a7-4905-a376-19b3c24be31b","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Openeqa: Embodied question answering in the era of foundation models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:92d12485024e4f046cf79f2542096c417a9d3d76c8f00925ee2323a9133315e8","observation_id":"548991b5-8b95-49eb-b3c8-66916b78b211","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11117","last_updated":"2025-05-23T06:54:57Z","snapshot_observed_at":"2026-08-07T17:04:54.246394Z","submitted_at":"2025-03-14T06:29:47Z","title":"Beyond the Destination: A Novel Benchmark for Exploration-Aware Embodied Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11117","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Beyond the destination: A novel benchmark for exploration-aware embodied question answering.arXiv preprint arXiv:2503.11117, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2503.11117","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:44e5174ffb869d79445d4c4fdf53b5ba722d29b0777e9c0c633ab01cfb249e84","observation_id":"5581c8c9-120a-4255-9a2d-5792b8eff9e3","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15725","last_updated":"2025-05-26T11:15:18Z","snapshot_observed_at":"2026-08-07T20:40:57.742715Z","submitted_at":"2025-05-21T16:31:28Z","title":"UAV-Flow Colosseo: A Real-World Benchmark for Flying-on-a-Word UAV Imitation Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15725","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"UA V-Flow colosseo: A real-world benchmark for flying-on-a-word uav imitation learning.arXiv preprint arXiv:2505.15725, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2505.15725","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:a121115bc6e6376bafa13ae4001e3b1908353e1cf259ea62e161c79a1f908f92","observation_id":"fe63365b-d6bc-407a-8c4c-1c2041e1069d","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Aerialvla: A vision-language-action model for aerial navigation with online dialogue","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:42bec94c510691808dcbc2453a5ee7c3bdc73c7f5da58b888f68b801b15954d4","observation_id":"8ced36ac-6223-4941-bdca-291caf44874f","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Aerialvla: A vision- language-action model for uav navigation via minimalist end-to-end control.arXiv preprint arXiv:2603.14363, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:9159f18a171e8cd336cd735981cb565847b64f62557b6ee89a16125fb18c871d","observation_id":"f2ba1898-2fca-4197-bd69-442c2e18eea1","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Mavic series","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:11346c5ff89a02d8d8b607b31758f82a6bbc857ec676367bc7c4f3279101d1f1","observation_id":"098b9c78-b15a-4f83-a880-67c1cbc8f38a","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Multi-Target Embodied Question Answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:9ba3685ca38d941b7312c38c19bdcf2026ae172ea5fa1178025d3fb6664632a7","observation_id":"b46ea428-49c4-4da0-b81e-35ae23e938cd","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Industryeqa: Pushing the frontiers of embodied question answering in industrial scenarios.Advances in Neural Information Processing Systems, 38, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:483a94c6df243cd077592f259cd1470b44ef870b47c07f3cd727024614ae28a9","observation_id":"fea6b4db-f737-4b5f-9395-37cbab92dbec","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Multi-step reasoning for embodied question answering via tool augmentation.arXiv preprint arXiv:2510.20310, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:4fe99ebcbf7d9d3654f985ce50b5af681c928bb9b8dab7d2af80310ab7eeca15","observation_id":"f4e95713-119c-4626-8a32-8929e5a75eab","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Knowledge-based em- bodied question answering.IEEE Transactions on Pattern Analysis and Machine Intelligence, 45(10):11948–11960, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:ff30ea1353e2e12df2b33f8883874d26fd04543bf83ffd4974720a28d2c8a5f7","observation_id":"b460c1fa-d17f-445e-b91f-770c810766ac","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"VideoNavQA: Bridging the gap between visual and embodied question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:5f4ede3f63b33dcfbdd39274f54628c1d6ab57f6e689734d65dfb897732c7e1b","observation_id":"eb030fc7-cfe1-4118-b96c-f17ea16bd1b6","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Memory-centric embodied question answering.arXiv preprint arXiv:2505.13948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:967aba81ba3a07482d25131b15b9feba7941e5fb425e6294b677e367c78faf5a","observation_id":"097ba459-cb3b-44d3-9782-783d1c3b62a3","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Episodic memory question answering","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:78243f7acad1deedb4ce7b7a8643694fedc09fe7c293f2a992806bcb363e367b","observation_id":"8e1caeaa-6064-4cdd-9829-f951c64c9d2b","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Multi-agent embodied question answering in interactive environments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:fe73b54146d30a74446db055bdd5fc09db5818484dc884c393aa0ca44a6da88f","observation_id":"e2635e1a-2363-4e59-9369-2011fa8e4c8d","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10726","last_updated":"2024-12-14T07:52:24Z","snapshot_observed_at":"2026-07-06T20:06:57.159160Z","submitted_at":"2024-12-14T07:52:24Z","title":"NoisyEQA: Benchmarking Embodied Question Answering Against Noisy Queries","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10726","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Noisyeqa: Benchmarking embodied question answering against noisy queries.arXiv preprint arXiv:2412.10726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2412.10726","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:54ee1c378352bc9e66add9f83806bcb30b4c5a777b517659bf3d6ce5b08222ab","observation_id":"8b2825cb-e159-4977-958f-d5338ee6b098","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14240","last_updated":"2025-08-02T16:25:00Z","snapshot_observed_at":"2026-08-10T18:10:24.287452Z","submitted_at":"2024-06-20T12:08:27Z","title":"CityNav: A Large-Scale Dataset for Real-World Aerial Navigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14240","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"CityNav: Language-goal aerial navigation dataset with geographic information.CoRR, abs/2406.14240, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2406.14240","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:37692f3d788704307ee727f6b7d4893f1ee93aa07b2d7960087f9c310365659d","observation_id":"074a669d-9ec7-46fc-9d82-c67a73c5afa1","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Uav-on: A benchmark for open-world object goal navigation with aerial agents","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:e86de7d9599f7623af1e8a79efc7e8d534e1d1f54f025ea4fd5f422249443dde","observation_id":"776eb022-43ef-48f7-9c04-7501ff7a1945","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Indooruav: Benchmarking vision-language uav navigation in continuous indoor environments","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:16c48a7a63dba6fde7d31fa3f8e728932d89ec0772bb80b851b705b45fe4e6b8","observation_id":"efd1f51d-619f-4091-8a1f-068260d378aa","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Air-vla: Vision-language-action systems for aerial manipulation.arXiv preprint arXiv:2601.21602, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:bfd1c2661524ee0b88fb1ea5471450b02b51faa96e9f207b447ae53c09541dee","observation_id":"026190fb-e32c-458b-87be-f20542d397a5","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"VLA-AN: An efficient and onboard vision- language-action framework for aerial navigation in complex environments.arXiv preprint arXiv:2512.15258, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:b1c5b1ddbcd01a6d8d1cce245aac3500951bf6208e9591cce38f6b944c73e2bb","observation_id":"2c229466-2b31-43c1-9ddc-70d50477bf56","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:66aa3cf480ee48133ad4020a6f2231f939237feab7e7d4917948539231e25dcf","observation_id":"057029e5-39c9-4c7f-816d-963169280aac","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"π0.5: A Vision- Language-Action Model with Open-World Generalization.arXiv preprint arXiv:2504.16054, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:b6c0cbb3b560241ec489a28a6513a79856a2974cea2e4b4d6397621024ea06c6","observation_id":"c02cd7a0-9197-4e15-8cda-5535448c17f8","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"π0: A Vision-Language-Action Flow Model for General Robot Control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:be258bcdd586e12c37bdd39232f072894ff492b0e337b7cff6c074c6ca74df5b","observation_id":"869d661f-12a4-471c-8c85-55cf9eee093d","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.09604","last_updated":"2024-10-12T17:49:26Z","snapshot_observed_at":"2026-08-10T21:32:15.321361Z","submitted_at":"2024-10-12T17:49:26Z","title":"EmbodiedCity: A Benchmark Platform for Embodied Agent in Real-world City Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.09604","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Embodiedcity: A benchmark platform for embodied agent in real-world city environment.arXiv preprint arXiv:2410.09604, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2410.09604","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:a9d3dd229b7c0e74ad9fbde9f6d25c97e1ab197704e0e0c8247b89ca8f6274e9","observation_id":"94f49250-5742-44d6-acaa-14475489b62d","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Libero: Benchmarking knowledge transfer for lifelong robot learning.Advances in Neural Information Processing Systems, 36:44776–44791, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:912e5a6472f447a8f963168513f3ee6b3e57b91f50c6c3d103c88a3dad468417","observation_id":"aa0a460a-161a-4b13-b12a-fafe34fc1bf7","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Openai gpt-5 system card.arXiv preprint arXiv:2601.03267, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:fd1dd8c6638c8d82a1cad2a357d083a58ae7a0ff5a884c612b5bc7935ca8a625","observation_id":"6f7c071d-7129-4c51-863a-afd7b06c035b","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:4aa1bf85795fb37fe4a11af95122b79622cd425ec0b160409ab94b113865d8d3","observation_id":"a3ab3178-5c1a-4cec-bf0e-ed97d8d6f24f","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:12864e81434a1fefe2801959a02a6692caec62af7860a17eafb31f851b583787","observation_id":"d2ee9151-8742-43c0-981b-d1045c6331a2","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36:34892–34916, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:fcbfd09338c36eef9649fcd2b14e3837ebb3c2070dce3e2b7e2d0762d2652b32","observation_id":"5082e87e-70d3-4112-8847-bf8fca0d5a52","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19645","last_updated":"2025-04-28T07:49:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-27T00:30:29Z","title":"Fine-Tuning Vision-Language-Action Models: Optimizing Speed and Success","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19645","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Fine-tuning vision-language-action models: Optimizing speed and success.arXiv preprint arXiv:2502.19645, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2502.19645","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:175542f0c8830ef8c89c9556c59581e485e33d8e426cdbaa50333695bc386aa5","observation_id":"5d74056e-16ef-465e-8911-350007963c11","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Fast-lio: A fast, robust lidar-inertial odometry package by tightly-coupled iterated kalman filter.IEEE Robotics and Automation Letters, 6(2):3317–3324, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:13368ff5a560fe1c7b2465cf2e4f2ad267fe376facd40bb0a443974a82a17488","observation_id":"dbeaa07e-23b9-468f-b1f1-d779179dcf60","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:4b1cb02b5eec445c6307f75fe30bacc54fc21db906d70743a077ff0c2d4ef8c2","observation_id":"2d699a46-bd72-4baf-af85-277815db9aa3","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:c9ecce0a2be232ac11058ad852c02ba5eaa76d35f4a6e5b1190c7e1bbfdfb9ee","observation_id":"7fffb3cc-b9e3-4c35-a477-df6d862a0273","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T13:42:23.610697Z","title":"move up\",","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-14T13:42:23.610697Z"},"links":{"citing_paper":"/paper/2607.10180"},"observation_digest":"sha256:cab631c7046051b2745ea430feff2141241110007d30e88f42d646931bec093f","observation_id":"09f3f1a1-256e-4ab1-8600-97f619134f02","resolution":{"observed_at":"2026-07-14T13:42:23.610697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.10180","last_updated":"2026-07-11T07:58:04Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T04:40:44.121577Z","submitted_at":"2026-07-11T07:58:04Z","title":"ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2607.10180."}