{"as_of":"2026-08-07T22:09:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:92a49fc333e55eaf5d7bde052e230615c12fc53d80283054b6404e2239254628","coverage":[{"denominator":77,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":77,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T00:31:01.102563Z","state":"measured"},{"denominator":77,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":77,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.15004/citation-record","integrity":"/paper/2607.15004/integrity","json":"/paper/2607.15004/citation-record.json","paper":"/paper/2607.15004"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.473005Z","title":"Claude Opus 4.6, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.473005Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:90590235d17d1b829754d4031ab96a47285be59913b1e564a8b03807d798b0a8","observation_id":"9147415b-02fa-41fe-bd41-e6b016bc046f","resolution":{"observed_at":"2026-08-02T00:30:52.473005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.541554Z","title":"Learning vision-based pursuit-evasion robot policies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.541554Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:df20d2b7d326009e3279c788903b5ae97664da2e7747c4fcfe59cae0ede08a55","observation_id":"9f927348-1d76-4aec-96d5-aae45bf36ecc","resolution":{"observed_at":"2026-08-02T00:30:52.541554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.628314Z","title":"Capera: Captioning events in aerial videos.Remote Sensing, 15(8):2139, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.628314Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:45bc8df5ac581895088dba4475613fb4f1637f639e791e25b3fbb88ac2631cba","observation_id":"5cdc9724-2b29-48b4-b3b4-92d066992f1f","resolution":{"observed_at":"2026-08-02T00:30:52.628314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.694121Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.694121Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:85fe127964c15adc8c0744538251cd952794d302ab81e69c15c72a86c5c6d6ff","observation_id":"01abdf97-32cf-4847-b494-f1840f840442","resolution":{"observed_at":"2026-08-02T00:30:52.694121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.772652Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.772652Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:1f40e64639b6db8c5c997f1f1ee1a72170be2661bba647a34bef83df542ec8c6","observation_id":"13ad6948-d90f-4b1e-b402-88c7cd4fac75","resolution":{"observed_at":"2026-08-02T00:30:52.772652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.832408Z","title":"Rt-1: Robotics transformer for real-world control at scale, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.832408Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:d5e5c7a5bce3cce9b04668f73e3904a0f0dfdd37a1e38431cd3f729c9ea6cbce","observation_id":"04af3347-fb60-497c-85d0-5fe2ff612634","resolution":{"observed_at":"2026-08-02T00:30:52.832408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:52.912988Z","title":"Gr-3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:52.912988Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:351f335c0e6af2d9ed86197ad201dce0b5a08fb8525b4a63b07a8483712cb2f2","observation_id":"e90aa3c3-0240-47c7-ad4d-fe4c066a5a2e","resolution":{"observed_at":"2026-08-02T00:30:52.912988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.05338","last_updated":"2026-05-06T18:09:15Z","snapshot_observed_at":"2026-07-06T23:17:58.119336Z","submitted_at":"2026-05-06T18:09:15Z","title":"Track A*: Fast Visibility-Aware Trajectory Planning for Active Target Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.05338","snapshot_observed_at":"2026-08-02T00:30:53.020583Z","title":"Track a*: Fast visibility-aware trajectory planning for active target tracking.arXiv preprint arXiv:2605.05338, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.020583Z"},"links":{"cited_paper":"/paper/2605.05338","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:46658b0ac855d46ca8ed3c98b1e66f44a8b7055e30369747c5dbc4b45a6849ce","observation_id":"658083d2-74b6-41e8-8669-141109df8a67","resolution":{"observed_at":"2026-08-02T00:30:53.020583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.19120","last_updated":"2026-05-18T21:11:18Z","snapshot_observed_at":"2026-08-01T17:39:34.320193Z","submitted_at":"2026-05-18T21:11:18Z","title":"CosFly: Plan in the Matrix, Fly in the World","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.19120","snapshot_observed_at":"2026-08-02T00:30:53.104574Z","title":"Cosfly: Plan in the matrix, fly in the world.arXiv preprint arXiv:2605.19120, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.104574Z"},"links":{"cited_paper":"/paper/2605.19120","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:1311b1f51564d8c8a32f2ea4244eed669d0fd4723b779130f57b37748e23d52c","observation_id":"42225576-c57f-46d7-903a-87e548eaee62","resolution":{"observed_at":"2026-08-02T00:30:53.104574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.13654","snapshot_observed_at":"2026-08-02T00:30:53.268914Z","title":"Vision-and-language navigation for uavs: Progress, challenges, and a research roadmap.arXiv preprint arXiv:2604.13654, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.268914Z"},"links":{"cited_paper":"/paper/2604.13654","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:26a809e507063b29a1257170a4059e7106256384469d0243f0dc4c0b4a49c76b","observation_id":"488c2310-ec1d-484d-8e8a-9c344ad9c5ba","resolution":{"observed_at":"2026-08-02T00:30:53.268914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:53.364508Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.364508Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:eb1108e6d06c49bae76d860e33de55bbcf038eec8807e8c3921b5e7e93a4548f","observation_id":"7ea320c8-d42b-4599-a218-86e3a86a15d1","resolution":{"observed_at":"2026-08-02T00:30:53.364508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:53.555352Z","title":"D-V AT: End-to-end visual active tracking for micro aerial vehicles.IEEE Robotics and Automation Letters, 9(6):5046–5053, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.555352Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:7c12d0894c71a1b4ac1e561c520cdd4437553a6442194661658e1456c5d665b6","observation_id":"86ad32a8-8e13-4f5a-8182-280e0238e712","resolution":{"observed_at":"2026-08-02T00:30:53.555352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:53.772456Z","title":"Open3d-vqa: A benchmark for embodied spatial concept reasoning with multimodal large language model in open space","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.772456Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:7dca1a70e3c05f0311191b8fd1350fac9dc53d3c203249f222ba7617bdefbb76","observation_id":"423d2689-efcc-4b33-8872-bdb80debed31","resolution":{"observed_at":"2026-08-02T00:30:53.772456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:53.888317Z","title":"Gemini 3.1 Pro Model Card, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.888317Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:199cf19178f657eb404dec53c7077bd5d87789c2f6f878499a7db90622611fab","observation_id":"6ff6de61-7e0a-4a09-a7de-facfdf2ed076","resolution":{"observed_at":"2026-08-02T00:30:53.888317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.22816","last_updated":"2026-05-21T17:58:26Z","snapshot_observed_at":"2026-08-03T04:05:29.788502Z","submitted_at":"2026-05-21T17:58:26Z","title":"AwareVLN: Reasoning with Self-awareness for Vision-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.22816","snapshot_observed_at":"2026-08-02T00:30:53.972225Z","title":"AwareVLN: Reasoning with self-awareness for vision-language navigation.arXiv preprint arXiv:2605.22816, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:53.972225Z"},"links":{"cited_paper":"/paper/2605.22816","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:fd90ec8eab38ed600590963c0ec407d31e1c5abc626b1c8120e89e362b21cb5c","observation_id":"dfc96182-3778-4438-80e0-6e96e4aaae77","resolution":{"observed_at":"2026-08-02T00:30:53.972225Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.036941Z","title":"A dual process vla: Efficient robotic manipulation leveraging vlm, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.036941Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:2630bca8ef4c335cb39368a8beb19b6fd4c641e53af76848a7e9ef582f2b83cd","observation_id":"b1a43b45-a09e-453c-9159-67959170e7f4","resolution":{"observed_at":"2026-08-02T00:30:54.036941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.110903Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.110903Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:15fee34fc986f6115c7b961da6f81c5aacc3ff33abc67644cbdd7ea4b8871f95","observation_id":"ac360ef9-5f3d-40a6-aa22-d0f4eebb41bd","resolution":{"observed_at":"2026-08-02T00:30:54.110903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.194125Z","title":"Navdreamer: Video models as zero-shot 3d navigators, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.194125Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:49bb7d4b31d80387113e6bb9e754ea8d851aa5914c1fd8b86c7e76b14a165118","observation_id":"3fd01931-06e3-48c8-ad6a-8c34d5a0e530","resolution":{"observed_at":"2026-08-02T00:30:54.194125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.275355Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.275355Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:fede27832e4625f808365e3e8fc47a5b965da501515f72c6676ec2eeb6c0c2ca","observation_id":"5e62303a-9a48-4fca-9555-fc925560555f","resolution":{"observed_at":"2026-08-02T00:30:54.275355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.354677Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.354677Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:7a20368c8941723b0cf6baa4cca02e5ea1f86c8753c9cd85beb985c1389ef639","observation_id":"91e49fbb-ddee-45f9-a981-9cd088332a96","resolution":{"observed_at":"2026-08-02T00:30:54.354677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.437489Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.437489Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:210171a672358a054c7be9fc1d566760a0619657e61b51c7af630a46be96876c","observation_id":"95111cd3-09e8-49f5-9512-7e83e5ba1f48","resolution":{"observed_at":"2026-08-02T00:30:54.437489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.545988Z","title":"A survey on vision-language-action models for autonomous driving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.545988Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:586f38576471bd055a19c12c2c7d9e7dbcdf5631914c3eef6b724cfd9ea29d3b","observation_id":"2b2bec50-dbdb-43dc-91e2-aacf6c0e4d2c","resolution":{"observed_at":"2026-08-02T00:30:54.545988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.611653Z","title":"A survey on detection, classification, and tracking of UA Vs using radar and communications systems.IEEE Communications Surveys & Tutorials, 28:3272–3310, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.611653Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:f55c26f8bfb3f1873e55118fffc86b86fa1cf8836b68da6a9e5d07c31db3394b","observation_id":"aed64537-5fc3-4dac-9ce3-36af2a2e746d","resolution":{"observed_at":"2026-08-02T00:30:54.611653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.753391Z","title":"Openvla: An open-source vision-language-action model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.753391Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:e49cb47ad1ae42f6889d631c11cbc493c7dcd1b3417c06e52f41f94f1c4ad6f0","observation_id":"9c8f59cd-e712-4eec-8ac7-0d880eec8503","resolution":{"observed_at":"2026-08-02T00:30:54.753391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.851382Z","title":"IB-AMG: Aircraft mission generation with inference-based vision-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.851382Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:d0b7752c691d7943bd61a2e11f18229e1a38e50218143516436edde75acbf66f","observation_id":"346d4018-9e6b-4851-a210-fb4ec0b6d044","resolution":{"observed_at":"2026-08-02T00:30:54.851382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:54.974436Z","title":"Hrvqa: A visual question answering benchmark for high-resolution aerial images.ISPRS Journal of Photogrammetry and Remote Sensing, 214:65–81, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:54.974436Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:587224b5e95cdb4ba57d982a41154dda23f84e05532e9f793c63554ad6d4c76e","observation_id":"ce5b7404-a383-429f-a98b-2e95c22327b9","resolution":{"observed_at":"2026-08-02T00:30:54.974436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.073997Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.073997Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:6c2d8035421ce48101d0ab0878065d9556f4b785ad994c6ea689ae3568ca0781","observation_id":"7f181653-59cb-4a1d-b596-7407f84c241a","resolution":{"observed_at":"2026-08-02T00:30:55.073997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.180608Z","title":"Adaptive and background-aware vision transformer for real-time UA V tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.180608Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:22b25d8cb7300ddb1dbf229a0e2167a42f5836357488e18e4c0ca816c4f496e7","observation_id":"b2c42664-b2d2-44f1-b538-7677e168bfd5","resolution":{"observed_at":"2026-08-02T00:30:55.180608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.320752Z","title":"AutoTrack: Towards high-performance visual tracking for UA V with automatic spatio-temporal regularization","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.320752Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:f4ff4c4d696620c589a2b4f56b5fd0ef8d0b0678c6494e290b6fd4b4174f8f27","observation_id":"1b3d0d5a-04ca-4b29-81b2-19be81c9c0ab","resolution":{"observed_at":"2026-08-02T00:30:55.320752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.433381Z","title":"Gr-rl: Going dexterous and precise for long-horizon robotic manipulation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.433381Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:ff4e24267c403ac4315fd293dde4ffc04a5794802a1ba5b18d6ab3eb5c305587","observation_id":"515d52d8-c7b2-4fb8-97b3-c6e5ca426ff2","resolution":{"observed_at":"2026-08-02T00:30:55.433381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.604921Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.604921Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:97ef14a7d47170f471014875eac432d14fa7c11f38c16b15e2af126bd4fb54d4","observation_id":"888d4f66-8c63-4767-8bb2-2ef3115c1eb7","resolution":{"observed_at":"2026-08-02T00:30:55.604921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.823469Z","title":"Trackvla++: Unleashing reasoning and memory capabilities in vla models for embodied visual tracking, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.823469Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:1f0ec434353c71dfa3651565091544198b5b5c88e4e44b9554781a2322b1eaa6","observation_id":"89818661-fb2f-4058-b568-3c0adc398e21","resolution":{"observed_at":"2026-08-02T00:30:55.823469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:55.899577Z","title":"Indooruav: Benchmarking vision-language uav navigation in continuous indoor environments, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:55.899577Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:512a9164e8ef9df8710d5bf256556888ea619571ac05c51b91ee6dbafd530f85","observation_id":"cffede97-a1e4-40ac-9e82-b12aaa5f22a8","resolution":{"observed_at":"2026-08-02T00:30:55.899577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:56.033720Z","title":"End-to-end active object tracking and its real-world deployment via reinforcement learning.IEEE Transactions on Pattern Analysis and Machine Intelligence, 42(6):1317–1332, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.033720Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:350d93f780d0626bfba5acda6c4f32b3c1215eaff397a72b9e1349bbdb236d89","observation_id":"8e56da20-0022-4efe-8f52-282e67473ded","resolution":{"observed_at":"2026-08-02T00:30:56.033720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:56.154200Z","title":"Cognitivedrone: A vla model and evaluation benchmark for real-time cognitive task solving and reasoning in uavs, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.154200Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:abafa74d2548972105968b40b2e2413eece560c64164a1263232eab7c87d50d5","observation_id":"3de097f5-5c40-4e9e-8ed1-d0aa967620c0","resolution":{"observed_at":"2026-08-02T00:30:56.154200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:56.221399Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.221399Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:53d2731fdc64220072946c77ac3adc1b3ec91628dcbe512177c22a5a7e4da014","observation_id":"dc77de28-8861-4a4a-8a50-4eee674ae74a","resolution":{"observed_at":"2026-08-02T00:30:56.221399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T00:30:56.333243Z","title":"Qwen3-VL Technical Report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.333243Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:efe67e49d1cc54f872b24b8943db5651c2aa99893866999eff0e4bc2d66c4754","observation_id":"d3d0ba36-9a22-4862-887c-273b9307e0a7","resolution":{"observed_at":"2026-08-02T00:30:56.333243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:56.429411Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.429411Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:3a3e2319c54a83688636f052b2008d38c5cc1c61a7b2b99e42079bfcdd3142e7","observation_id":"84eefc26-9346-4284-b37e-2127d783d709","resolution":{"observed_at":"2026-08-02T00:30:56.429411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:56.505477Z","title":"UA V-VLA: Vision-language-action system for large scale aerial mission generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.505477Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:f4b6c431e258a9f991356fefc74c5a02a3f5e3a47c045e75156d26c71b684a8a","observation_id":"ebb327cf-c368-4b1b-8bc4-689f985db806","resolution":{"observed_at":"2026-08-02T00:30:56.505477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-02T00:30:56.660566Z","title":"Proximal policy optimization algorithms.arXiv preprint arXiv:1707.06347, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.660566Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:d86900cf2bf16276bd945ac3445de0dd587c30209ce1b82b2159195790411efd","observation_id":"155bab52-1e0b-418a-b314-ecec8d2e049f","resolution":{"observed_at":"2026-08-02T00:30:56.660566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:56.790439Z","title":"Racevla: Vla-based racing drone navigation with human-like behaviour, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.790439Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:536569fd50bf47c429ca41f8879bb3a06df07e9b1b7545cdefee1449c84a7455","observation_id":"0fad07e0-998c-4bdc-8129-da55c804560d","resolution":{"observed_at":"2026-08-02T00:30:56.790439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-02T00:30:56.903917Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:56.903917Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:6f8460c59967f2e63af4f45c413301f3aa83480203ee154c561960cfea357c0d","observation_id":"98e3af9f-ab11-4681-b91b-f92f5f334494","resolution":{"observed_at":"2026-08-02T00:30:56.903917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21432","last_updated":"2025-07-08T15:03:11Z","snapshot_observed_at":"2026-08-07T13:25:56.266062Z","submitted_at":"2025-05-27T17:04:21Z","title":"Hume: Introducing System-2 Thinking in Visual-Language-Action Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21432","snapshot_observed_at":"2026-08-02T00:30:57.030649Z","title":"Hume: Introducing system-2 thinking in visual-language-action model.arXiv preprint arXiv:2505.21432, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.030649Z"},"links":{"cited_paper":"/paper/2505.21432","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:3f146d9caa6f87dabef12fedade50a8fb1d52de599e8abf376c659bbbf367087","observation_id":"9c83eae8-90ec-454b-8d38-30cba65811db","resolution":{"observed_at":"2026-08-02T00:30:57.030649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.190915Z","title":"UA V-ground visual tracking: A unified dataset and collaborative learning approach.IEEE Transactions on Circuits and Systems for Video Technology, 34(5):3619–3632, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.190915Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:647d303e0840e435e77c995e301640e0cf7cfa9232183fc94c76a457235f78e8","observation_id":"ed36261f-0dee-42fd-b261-803de06b6375","resolution":{"observed_at":"2026-08-02T00:30:57.190915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.303103Z","title":"Open-world drone active tracking with goal-centered rewards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.303103Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:8ea88bd427b63390958a9e97f049ef2868f0420a7576c11ed2502359e7955189","observation_id":"06b11482-0421-45a8-98ea-f39815f701bc","resolution":{"observed_at":"2026-08-02T00:30:57.303103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.425394Z","title":"Air-vla: Vision-language-action systems for aerial manipulation, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.425394Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:868c041ae711c46b50ec73ec21e239053a3fe05eff96cd5ee7e22319719f4b23","observation_id":"476e087f-ccbf-4e56-92d2-180ce1df6f39","resolution":{"observed_at":"2026-08-02T00:30:57.425394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.573949Z","title":"Moving target tracking by unmanned aerial vehicle: A survey and taxonomy.IEEE Transactions on Industrial Informatics, 20(5):7056–7068, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.573949Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:666e1aa63c7f5e6855a8c0785cc0788acc01067e912e1a21caa928251ebfccf6","observation_id":"d20cade2-4d33-4d41-b6db-4974ba826c13","resolution":{"observed_at":"2026-08-02T00:30:57.573949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.576459Z","title":"Autofly: Vision-language-action model for uav autonomous navigation in the wild, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.576459Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:c0736c3a359ae49d2ff34f04cf9b2a70a57680abf486baa7446b8a2bc5c068be","observation_id":"d4996508-d672-4fa9-97a4-af8de049e3df","resolution":{"observed_at":"2026-08-02T00:30:57.576459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.591367Z","title":"Refdrone: A challenging benchmark for referring expression comprehension in drone scenes","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.591367Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:02842d9bc03c3a28e7e8bab5445e8a05080ed05cd8a09dacc587c5a068e6cf34","observation_id":"5792cc3c-6449-4499-a430-5b1c1c1bbaea","resolution":{"observed_at":"2026-08-02T00:30:57.591367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00088","last_updated":"2026-01-07T09:09:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T01:25:34Z","title":"Alpamayo-R1: Bridging Reasoning and Action Prediction for Generalizable Autonomous Driving in the Long Tail","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00088","snapshot_observed_at":"2026-08-02T00:30:57.747712Z","title":"Alpamayo-r1: Bridging reasoning and action prediction for generalizable autonomous driving in the long tail.arXiv preprint arXiv:2511.00088, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.747712Z"},"links":{"cited_paper":"/paper/2511.00088","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:003e06e47ef2c694a4f379c1f80d494f383994cda22fcb47dc50efe9bd91ebbf","observation_id":"e90a1f70-a893-4a06-b909-e2bac27b74ad","resolution":{"observed_at":"2026-08-02T00:30:57.747712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.842378Z","title":"Octo: An open-source generalist robot policy, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.842378Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:bedd6083c1433d4e55a0caf20963e29b418dbfceb104def2982d1ad51bd97925","observation_id":"29178ce5-55e4-4941-82c0-ae218ac484ff","resolution":{"observed_at":"2026-08-02T00:30:57.842378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:57.956750Z","title":"UA Vs meet LLMs: Overviews and perspectives toward agentic low-altitude mobility","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:57.956750Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:f1a03880a173da8cf0bccd01c79ee4ec40dc55cb47d12609889e827245f52509","observation_id":"d5ee6ee6-b4cd-4919-b4d0-c742c2e7505f","resolution":{"observed_at":"2026-08-02T00:30:57.956750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.021983Z","title":"Trackvla: Embodied visual tracking in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.021983Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:4e99f397e5c6708296b5f22af6a9ad6e793d42a1345a2f5aa75d9d0b60a817bf","observation_id":"7096fc29-b91e-4271-b0e7-7c61cf72611d","resolution":{"observed_at":"2026-08-02T00:30:58.021983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.107923Z","title":"Uav-flow colosseo: A real-world benchmark for flying-on-a-word uav imitation learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.107923Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:1e2e1ada0ed564c357808c67c8d3d4015a165b1cef8b7581fedb1daf062b003b","observation_id":"9564da37-a475-4bfe-9346-22f4ee321f0c","resolution":{"observed_at":"2026-08-02T00:30:58.107923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.17776","last_updated":"2026-05-20T07:06:32Z","snapshot_observed_at":"2026-07-31T09:47:00.634742Z","submitted_at":"2026-05-18T02:49:58Z","title":"CosFly-Track: A Large-Scale Multi-Modal Dataset for UAV Visual Tracking via Multi-Constraint Trajectory Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.17776","snapshot_observed_at":"2026-08-02T00:30:58.207832Z","title":"Cosfly-track: A large-scale multi-modal dataset for uav visual tracking via multi-constraint trajectory optimization.arXiv preprint arXiv:2605.17776, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.207832Z"},"links":{"cited_paper":"/paper/2605.17776","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:5df2567cf5dd7bd3284fa553b824bae02a11612d8a9477809f38fbe6f662b83f","observation_id":"9484d67f-23f5-411f-a397-12a65bcf5342","resolution":{"observed_at":"2026-08-02T00:30:58.207832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.343671Z","title":"Hierarchical instruction-aware embodied visual tracking, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.343671Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:4f97e79517d9eea273c11e780cc7117c2e3b7a8e6911da23f4905e0910434cad","observation_id":"f9a72a46-e4c7-4c5f-8923-287f39b2f7c1","resolution":{"observed_at":"2026-08-02T00:30:58.343671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.430507Z","title":"VLM can be a good assistant: Enhancing embodied visual tracking with self-improving vision-language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.430507Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:f4ccbd21c59a9576f44702be3d63d11a9e85ba7365873ebc92c8d2cfc0177746","observation_id":"713b3f22-6089-4ba9-b80e-7854c52b1bd8","resolution":{"observed_at":"2026-08-02T00:30:58.430507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.544878Z","title":"Cognitive embodied learning for anomaly active target tracking.Communications Engineering, 4(1):224, Nov 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.544878Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:8120cc292348829db9a3893efb1dec65ea314d789ece4e1d8c39fefea8d419fe","observation_id":"e609a864-402a-4f70-ab06-2324e2b25789","resolution":{"observed_at":"2026-08-02T00:30:58.544878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.632279Z","title":"Learning an adaptive and view-invariant vision transformer for real-time UA V tracking.IEEE Transactions on Circuits and Systems for Video Technology, 36(2):2403–2418, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.632279Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:a197deced0eefa14c41d52e4f39ac449c3abad11181939412bbc44830295b97e","observation_id":"7d5f875f-2cc3-45e9-ad95-01e20a4ecaa5","resolution":{"observed_at":"2026-08-02T00:30:58.632279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.725424Z","title":"Vla-an: An efficient and onboard vision-language-action framework for aerial navigation in complex environments, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.725424Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:a6009981617a81a5c5183e2445632dfd9ab6de4567ec4e0a211cae05dd6d71ae","observation_id":"8d1b586a-babe-4fa5-bfaa-b3199e3bcf8c","resolution":{"observed_at":"2026-08-02T00:30:58.725424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.860462Z","title":"Anti-distractor active object tracking in 3D environments.IEEE Transactions on Circuits and Systems for Video Technology, 32(6):3697–3707, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.860462Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:6bafa3a97e247b9c0551f0cfba9f9d0e7c112801cf658b4d53afb0dc1aaa1000","observation_id":"b75d4155-4d27-403e-826a-502e83d29101","resolution":{"observed_at":"2026-08-02T00:30:58.860462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:58.999585Z","title":"AerialVLA: A vision-language-action model for uav navigation via minimalist end-to-end control.arXiv preprint arXiv:2603.14363, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:58.999585Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:70af8ab958cfe6f6d2d1d7a249a6ca0f6a5c645b54d4124f5fa2eb98649201fa","observation_id":"d26b3ac5-61a8-4731-b313-4102afbd2b53","resolution":{"observed_at":"2026-08-02T00:30:58.999585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:59.210630Z","title":"Similarity-guided layer-adaptive vision transformer for UA V tracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.210630Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:09f7cd59c058d00ea88a3f8e7561d5230dc7ea947d5971aebaceccea194caae0","observation_id":"5954700f-9dbd-4402-ad7c-4d642f32c880","resolution":{"observed_at":"2026-08-02T00:30:59.210630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:59.327078Z","title":"Handling occlusion in UA V visual tracking with query-guided redetection.IEEE Transactions on Instrumentation and Measurement, 73:1–17, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.327078Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:9f65bcdbcb6357f9dd18fe5001a8f85e0dc8855dc7e37aa5f92f2f2c060a0f68","observation_id":"ed8fb1a8-ec8d-4228-b746-9af389b4fba1","resolution":{"observed_at":"2026-08-02T00:30:59.327078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:59.438588Z","title":"Ezreal: Enhancing zero-shot outdoor robot navigation toward distant targets under varying visibility.arXiv preprint arXiv:2509.13720, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.438588Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:dd6e249fc6a99d08a3b9642c31c49f52a9d573b8e08ceaad1372e8ec0bab4856","observation_id":"6274f652-a28c-4702-be34-7e5cb7f349ea","resolution":{"observed_at":"2026-08-02T00:30:59.438588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.31066","last_updated":"2026-05-29T09:36:08Z","snapshot_observed_at":"2026-08-07T21:01:12.863101Z","submitted_at":"2026-05-29T09:36:08Z","title":"Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.31066","snapshot_observed_at":"2026-08-02T00:30:59.522124Z","title":"Can aerial vla models cooperate? evaluating closed-loop air-ground coordination with carla-air.arXiv preprint arXiv:2605.31066, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.522124Z"},"links":{"cited_paper":"/paper/2605.31066","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:b9c7f714db4190bbfa42c9c658eaf6fa4f6c44af7eb59798395e0826c8bac4ea","observation_id":"5b462e94-ad0e-4a26-8363-223a5817c62a","resolution":{"observed_at":"2026-08-02T00:30:59.522124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28032","last_updated":"2026-04-22T08:50:07Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-30T04:49:29Z","title":"CARLA-Air: Fly Drones Inside a CARLA World -- A Unified Infrastructure for Air-Ground Embodied Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28032","snapshot_observed_at":"2026-08-02T00:30:59.691095Z","title":"Carla-air: Fly drones inside a carla world–a unified infrastructure for air-ground embodied intelligence.arXiv preprint arXiv:2603.28032, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.691095Z"},"links":{"cited_paper":"/paper/2603.28032","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:0492c220b9817e408dff90fad2278e6adbaf0530217cdaf5a22887814d41ecb3","observation_id":"044b7423-fca7-42c3-b479-355e979605af","resolution":{"observed_at":"2026-08-02T00:30:59.691095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:59.769366Z","title":"Aircopbench: A benchmark for multi-drone collaborative embodied perception and reasoning.arXiv preprint arXiv:2511.11025, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.769366Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:8e6fbba900d08a72c3ae1375fc01114e0efc9cb3b5ec186ac1506786b8e50459","observation_id":"3425e76b-55b0-49b7-ba88-e4203ac853b7","resolution":{"observed_at":"2026-08-02T00:30:59.769366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:30:59.948815Z","title":"Igniting vlms toward the embodied space, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-02T00:30:59.948815Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:0e53c2ad768464ebce0ac4d7d3dac203b1b0495f22aa812911d1b5913c62c330","observation_id":"07ecc50e-ec42-4e04-baa0-f31cacacc1b9","resolution":{"observed_at":"2026-08-02T00:30:59.948815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:31:00.052524Z","title":"Uni-navid: A video-based vision-language-action model for unifying embodied navigation tasks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.052524Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:79a1f048e1dd3f915a5db38eb3064bb6a4b0682a682a8303c9c44e730528006e","observation_id":"014ed935-b587-4356-8b74-1617b1370bcd","resolution":{"observed_at":"2026-08-02T00:31:00.052524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02241","last_updated":"2026-04-10T14:04:42Z","snapshot_observed_at":"2026-07-06T22:51:44.663367Z","submitted_at":"2026-04-02T16:33:38Z","title":"UAV-Track VLA: Embodied Aerial Tracking via Vision-Language-Action Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.02241","snapshot_observed_at":"2026-08-02T00:31:00.221664Z","title":"UA V-Track VLA: Embodied aerial tracking via vision-language-action models.arXiv preprint arXiv:2604.02241, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.221664Z"},"links":{"cited_paper":"/paper/2604.02241","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:867c9f3950739f59817c395694708b034581712d49a7a972d7f3b7e75721d416","observation_id":"c9caa93b-20ac-49a1-85f8-a28834bcf630","resolution":{"observed_at":"2026-08-02T00:31:00.221664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.15964","last_updated":"2026-05-15T13:55:39Z","snapshot_observed_at":"2026-07-06T23:27:11.118592Z","submitted_at":"2026-05-15T13:55:39Z","title":"WorldVLN: Autoregressive World Action Model for Aerial Vision-Language Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.15964","snapshot_observed_at":"2026-08-02T00:31:00.334210Z","title":"WorldVLN: Autoregressive world action model for aerial vision-language navigation.arXiv preprint arXiv:2605.15964, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.334210Z"},"links":{"cited_paper":"/paper/2605.15964","citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:76628146c7843b889f2c9b667acd0099459f48e20621c3c207f87ec36d8c0709","observation_id":"1be4ebf9-9e6f-4046-87c9-5e13a5318c0c","resolution":{"observed_at":"2026-08-02T00:31:00.334210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:31:00.436972Z","title":"Zhao, Vikash Kumar, Sergey Levine, and Chelsea Finn","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.436972Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:b34197973fb8f4446c85053b27b220e714537a7814ff93c090087c4be251d080","observation_id":"de63d93e-927a-4e70-b47b-7b8bb6ba7905","resolution":{"observed_at":"2026-08-02T00:31:00.436972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:31:00.597705Z","title":"RSPT: Reconstruct surroundings and predict trajectory for generalizable active object tracking","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.597705Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:9340d6eb6a7d10774b072df5760087e12d19f818c86ffd37814fd5cfdac95b19","observation_id":"ace20571-23b8-4e90-ab93-d0ae0a562015","resolution":{"observed_at":"2026-08-02T00:31:00.597705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:31:00.726170Z","title":"UnrealZoo: Enriching photo-realistic virtual worlds for embodied ai","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.726170Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:4141d33ae7664ed044f7e49b11f7e6645ea471e89a84f413c8b42a6f30fcab47","observation_id":"6dabe588-2c25-4133-a6a3-f8cbd2e71f45","resolution":{"observed_at":"2026-08-02T00:31:00.726170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:31:00.911078Z","title":"Airspatialbot: A spatially-aware aerial agent for fine-grained vehicle attribute recognition and retrieval.IEEE Transactions on Geoscience and Remote Sensing, 63:1–15, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:00.911078Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:9f35bb7e133466422b3b9a7c2272eeae8b36645eeab17f8719d9da1795ed4862","observation_id":"3447dce3-f820-4290-8abd-4c8f0b1fa72c","resolution":{"observed_at":"2026-08-02T00:31:00.911078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T00:31:01.102563Z","title":"Multimodal mathematical reasoning embedded in aerial vehicle imagery: Benchmarking, analysis, and exploration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-02T00:31:01.102563Z"},"links":{"citing_paper":"/paper/2607.15004"},"observation_digest":"sha256:6bd42ef67114eac0b67fb2ff85c4b27b5216afb17d6f906d8bdaf1f6918dda83","observation_id":"e2093031-0c8d-4e8c-8296-ad19a3a3f163","resolution":{"observed_at":"2026-08-02T00:31:01.102563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.15004","last_updated":"2026-07-16T13:52:08Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T00:30:51.207475Z","submitted_at":"2026-07-16T13:52:08Z","title":"CosFly-VLA: A Spatially Aware Vision-Language-Action Model for UAV Tracking"},"reference_resolution":{"displayed":77,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":77,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":77},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 77 of 77 outbound references and 0 inbound Pith citation observations for arXiv:2607.15004."}