{"as_of":"2026-08-06T22:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b6d6d04e40b2b61202d7a9bad9f82a8812b8fcf0e43bcf904eaf213917f07239","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T17:13:10.713616Z","state":"measured"},{"denominator":25,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":25,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:42:59.130907Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"cited_work":{"arxiv_id":"2606.01205","doi":"10.48550/arxiv.2606.01205","metadata_source":"pith","pith_arxiv_id":"2606.01205","snapshot_observed_at":"2026-08-05T02:49:54.815029Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","venue":"cs.RO","work_id":"e5e760f1-c76a-4466-ab61-b2672cb43f42","year":2026},"citing_paper":{"arxiv_id":"2608.02356","last_updated":"2026-08-04T04:44:48Z","snapshot_observed_at":"2026-08-06T21:33:15.518430Z","submitted_at":"2026-08-03T15:07:11Z","title":"SkillTrace: Traversing a Query-Skill Graph for Composable LLM Agents","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T08:50:11.584806Z"},"links":{"cited_paper":"/paper/2606.01205","citing_paper":"/paper/2608.02356"},"observation_digest":"sha256:794dfcd2b9b52a7162073c6514cbb0186695ee3ec66043286a57a7305a898728","observation_id":"76bfd3cf-f3cc-47e7-9305-ad386db48e4e","resolution":{"observed_at":"2026-08-04T08:54:16.286985Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01205","snapshot_observed_at":"2026-08-06T15:42:59.130907Z","title":"arXiv preprint arXiv:2606.01205 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04825","last_updated":"2026-08-05T13:27:07Z","snapshot_observed_at":"2026-08-06T21:17:07.270167Z","submitted_at":"2026-08-05T13:27:07Z","title":"Deliberate Before You Fly: Vision-Guided Spatial Deliberation for UAV See-and-Reach Navigation","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T15:42:59.130907Z"},"links":{"cited_paper":"/paper/2606.01205","citing_paper":"/paper/2608.04825"},"observation_digest":"sha256:f1234241f311fd609208a2dbbfeb048dd22d37140b9afa9ec5b9626061052d7d","observation_id":"761234f3-623d-4c88-9c48-ae353740f63d","resolution":{"observed_at":"2026-08-06T15:42:59.130907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.01205/citation-record","integrity":"/paper/2606.01205/integrity","json":"/paper/2606.01205/citation-record.json","paper":"/paper/2606.01205"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Vision-language navigation: a survey and taxonomy,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:1778bfe1a7444416d9babb7510782af88d37bd7e7644adcfea8bebdd32f3951c","observation_id":"a511e124-18f5-4c2d-bb81-95e4b1993152","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"cited_work":{"arxiv_id":"2402.15852","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.15852","snapshot_observed_at":"2026-07-10T08:47:01.956969Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","venue":"cs.CV","work_id":"a18e1283-0ce1-4c27-bf05-99efa4f917c4","year":2024},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2402.15852","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:998cabc62724e65271eb05557cef851788ebb9cac1c8c3860617eb9787943446","observation_id":"12f331b0-714a-4dcd-bab0-fda0463b39fa","resolution":{"observed_at":"2026-07-01T21:16:14.903772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":"2406.09246","doi":"10.18653/v1/2022.naacl-main.68","metadata_source":"pith","pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","venue":"cs.RO","work_id":"3e7e65c5-5aed-4fe9-8414-2092bcb31cc7","year":2024},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:7f14563d1e11756d2c5726cd122ea10dc8c37c48cc65c3920c64d6ae4c915c45","observation_id":"077a25af-c10c-4a41-a26b-932756bfa018","resolution":{"observed_at":"2026-07-01T21:16:14.932419Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:c850c705f993d47d643aab0f5f9fc0f8eefe5ad7a5d570fe9b47ce978bdb2b57","observation_id":"eb772f8d-d6fc-4a93-80ac-47f6cf900cae","resolution":{"observed_at":"2026-07-01T21:16:14.927426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Airscape: An aerial generative world model with motion controllability,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:5782c366dacc8916179877b66f4387d140f97f35f5c60ebe24033197d752a2b7","observation_id":"1419e32d-799c-4364-80ad-af4bb8e4f0d4","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Uav-flow colosseo: A real-world benchmark for flying-on- a-word uav imitation learning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:2172a3dcb40f8ae7cadd6afc040c8a5c36ab8ca6167d32c63768d3301214b54c","observation_id":"ee8f230c-3bc8-4717-886e-bc65c53ae5c0","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Vision-and-language navigation: Interpreting visually-grounded navigation instructions in real environ- ments,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:dcf921a4b02e59656ed0134779e3ddcd83c6b196f72efa7d3ddd21a6719c7120","observation_id":"3c0328b4-d0d3-4b33-8ac0-2588e829c96a","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Beyond the nav-graph: Vision-and-language navigation in continuous environments,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:51046c28cfc54a8ab36d25bd179e5220c634d93626daea070c6d819c27f64ba3","observation_id":"8adc6f3c-911b-472b-bf66-a2555dbc182f","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.01691","last_updated":"2022-08-16T16:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-04T17:57:11Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","version":2},"cited_work":{"arxiv_id":"2204.01691","doi":"10.48550/arxiv.2204.01691","metadata_source":"pith","pith_arxiv_id":"2204.01691","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Do As I Can, Not As I Say: Grounding Language in Robotic Affordances","venue":"cs.RO","work_id":"037320f1-b0a9-4cbe-a639-bfb25409ce71","year":2022},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2204.01691","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:ba748fbb90c74383ca8821bbfd5008741c8b7423d3edca0cdb606e4fab93d7c4","observation_id":"76fe94af-1ed2-4b42-9597-4b7f01a80223","resolution":{"observed_at":"2026-07-01T21:16:14.929924Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Rt-1: Robotics transformer for real-world control at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:e98d6f68c8f2971ff06a934aee4725641a14174dbaa47ff43cedf3c4f7c9fbdc","observation_id":"5a63de00-3d62-44da-a519-25ea82d086cc","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:631edea5abf3a105342ebb67a91d28c5e96739fa72a63eb76fa1efb799567669","observation_id":"f8957b9c-2727-4a97-afc6-f8da44ab2be6","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.04769","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T20:46:33.621103Z","title":"Vision-language- action models: Concepts, progress, applications and chal- lenges.arXiv preprint arXiv:2505.04769","venue":null,"work_id":"5f0bf2cc-1901-4ad0-940b-1e742cc6d7e7","year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:d5cc85af77e7b4f252336433e15a718d2283d8e05e8a1982ebf6c0db6ae2e348","observation_id":"40fcf209-6c6e-4e10-bddd-daa7c2b88177","resolution":{"observed_at":"2026-07-01T21:16:14.909681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.18041","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T23:07:47.818858Z","title":"OpenFly: A comprehensive platform for aerial vision-language navigation","venue":null,"work_id":"366eda25-a91d-4a98-ba54-456c799cf63f","year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:b0cf3bb484b16efcd3fcf5f0402ec670a3c47687b327d5e1beb1dabbcae3aa97","observation_id":"5d13ee26-ab66-439c-9985-b2505a19cdf1","resolution":{"observed_at":"2026-07-01T21:16:14.906709Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Mastering diverse control tasks through world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:017fe4253cf30d5ca1cc9d3bcb8e61f8efb7897d538b97f179f98c1756dd3f6e","observation_id":"09e6d90a-6011-4a9e-a0c1-7b764b8f5ec5","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12090","last_updated":"2026-05-12T13:10:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-12T13:10:52Z","title":"World Action Models: The Next Frontier in Embodied AI","version":1},"cited_work":{"arxiv_id":"2605.12090","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12090","snapshot_observed_at":"2026-07-04T21:00:09.552907Z","title":"World Action Models: The Next Frontier in Embodied AI","venue":"cs.RO","work_id":"730d5880-1bd2-4a21-b480-c5c34ec9dd1e","year":2026},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2605.12090","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:003f5aef47e66c68f170761aaf220fff236520e1ae7ad8e4bbcdc61eefbf98d3","observation_id":"73838e77-2f03-46ef-a675-af443e7171d3","resolution":{"observed_at":"2026-07-01T21:16:14.900379Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:ecedc6de3af40d2aecdc02c05aee3b3d60bad5d3732d59cf042b56869b2acf04","observation_id":"9ce8d1c6-0ba0-4301-a052-d5281ee024cc","resolution":{"observed_at":"2026-07-01T21:16:14.924351Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Navigation world models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:b95c5066cb71edc5fda3c3adc8e1bab7e03277e047e303f9f8344f87e65c8901","observation_id":"98cc0af8-91e8-48b2-a608-94dc48f01a5e","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.21797","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T21:16:14.910927Z","title":"Mowm: Mixture-of-world-models for embodied planning via latent-to-pixel feature modulation.arXiv preprint arXiv:2509.21797","venue":null,"work_id":"a9872386-8a13-4094-9958-c0093b85fe6c","year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:77229ca1222fd1c27723db268e8cc5d76639f27222d15f514cfffb366f4d93cb","observation_id":"bdd9825d-d69b-46b2-b33d-3e207ee110fa","resolution":{"observed_at":"2026-07-01T21:16:14.912624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.09765","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T04:09:35.296824Z","title":"Navdreamer: Video models as zero-shot 3d navigators","venue":null,"work_id":"e6ee72ec-63f9-470a-971f-735a3d4b8c41","year":2026},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:d980f7b2148775e1e8b248157470cb9afc69123ddb4f4ec13ae89fbe35d093b1","observation_id":"6c0e09e0-e1ed-4289-ae1a-639aa5503cb9","resolution":{"observed_at":"2026-07-01T21:16:14.915770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Robust real-time uav replanning using guided gradient-based optimization and topological paths,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:1449e52d36a073940f1b4b21fab6a44682d9c147fbcc97fcf900fd8b2ed4ace4","observation_id":"39397bc1-c891-43ad-b7d8-2b4e06011b49","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02101","last_updated":"2025-03-13T18:35:06Z","snapshot_observed_at":"2026-07-06T17:54:39.685251Z","submitted_at":"2024-04-02T16:52:41Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","version":2},"cited_work":{"arxiv_id":"2404.02101","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.02101","snapshot_observed_at":"2026-07-10T01:46:41.167891Z","title":"CameraCtrl: Enabling Camera Control for Text-to-Video Generation","venue":"cs.CV","work_id":"1c05c278-c023-4ef0-a359-25a41f1065eb","year":2024},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2404.02101","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:47f100629457af631912237af926fe523beca7032e48448bbba324ba883503f1","observation_id":"c17b6962-04dd-4eb0-aafb-e8fd3068be14","resolution":{"observed_at":"2026-07-01T21:16:14.918474Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T17:13:10.713616Z","title":"Cogvideox: Text-to-video diffusion models with an expert transformer,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:84523ed385ed34761574d390020cca9e842d5c194b49b0d11c016a0aded6224c","observation_id":"36ae7bfd-361c-4b23-9888-3cd66a20d07a","resolution":{"observed_at":"2026-06-28T17:13:10.713616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.18870","last_updated":"2025-11-25T02:52:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-24T08:22:07Z","title":"HunyuanVideo 1.5 Technical Report","version":2},"cited_work":{"arxiv_id":"2511.18870","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.18870","snapshot_observed_at":"2026-07-10T01:46:40.932396Z","title":"HunyuanVideo 1.5 Technical Report","venue":"cs.CV","work_id":"ed898a38-b053-407c-bbce-41561510c1de","year":2025},"citing_paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T17:13:10.713616Z"},"links":{"cited_paper":"/paper/2511.18870","citing_paper":"/paper/2606.01205"},"observation_digest":"sha256:cc6438aa9761a4949cdbc4592ad1a275517f793b4c06eb461327fbb403c6ebbd","observation_id":"3687c8b7-7fb8-4512-b102-88a8532d02cb","resolution":{"observed_at":"2026-07-01T21:16:14.921309Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2606.01205","last_updated":"2026-06-08T02:19:04Z","latest_version":2,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-03T09:06:01.551090Z","submitted_at":"2026-05-31T12:39:44Z","title":"ImagineUAV: Aerial Vision-Language Navigation via World-Action Modeling and Kinodynamic Planning"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":12,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 2 inbound Pith citation observations for arXiv:2606.01205."}