{"as_of":"2026-08-09T13:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:86077233baa44fc5c4744566d83f6ffa56dbb9795e89f5d94f32c900b881cd1e","coverage":[{"denominator":80,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":80,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:58:42.191931Z","state":"measured"},{"denominator":97,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":97,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T19:01:24.042462Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T20:00:08.776707Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-06T19:01:24.042462Z","title":"TrackVLA: Embodied visual tracking in the wild,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.06747","last_updated":"2025-07-09T11:02:46Z","snapshot_observed_at":"2026-08-09T11:30:50.030286Z","submitted_at":"2025-07-09T11:02:46Z","title":"LOVON: Legged Open-Vocabulary Object Navigator","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T19:01:24.042462Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2507.06747"},"observation_digest":"sha256:fe305837bd21ef54a86b796ece9a139980f701375332cc74a2be6c76f24803f5","observation_id":"f5a7e884-968a-4762-9def-5cc190bb4ba6","resolution":{"observed_at":"2026-08-06T19:01:24.042462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2512.21714","last_updated":"2026-04-08T16:31:40Z","snapshot_observed_at":"2026-08-03T01:54:32.856831Z","submitted_at":"2025-12-25T15:31:24Z","title":"AstraNav-World: World Model for Foresight Control and Consistency","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T19:23:58.769472Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2512.21714"},"observation_digest":"sha256:74d0b24d181a45afd21a92ed41d6d3dcd4db295cee7162a4913a5aec2de72dab","observation_id":"c4d21945-511f-4a20-b3b7-02526a9de368","resolution":{"observed_at":"2026-05-16T19:28:20.893136Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T17:15:42.447861Z","title":"arXiv preprint arXiv:2505.23189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-08T02:26:12.336195Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T17:15:42.447861Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:52c5950fa2f6ccf2829269c8f45af0ba139a9a28fcd370baafd5405aebe32f96","observation_id":"93820870-7b18-496e-a6ff-32562bdb12e1","resolution":{"observed_at":"2026-08-02T17:15:42.447861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-04T05:43:11.874741Z","title":"arXiv preprint arXiv:2505.23189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.27577","last_updated":"2026-08-01T10:28:12Z","snapshot_observed_at":"2026-08-08T02:26:12.336195Z","submitted_at":"2026-03-29T08:34:05Z","title":"Structured Observation Language for Efficient and Generalizable Vision-Language Navigation","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T05:43:11.874741Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2603.27577"},"observation_digest":"sha256:4b8b060f6d68a8e9373b43de78e5a160b3b443b9ede82d6a1d5341f06aa36075","observation_id":"49f47abe-c77e-4b8b-a110-c8f9d7de9118","resolution":{"observed_at":"2026-08-04T05:43:11.874741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.13654","last_updated":"2026-04-15T09:20:02Z","snapshot_observed_at":"2026-07-06T23:01:37.207817Z","submitted_at":"2026-04-15T09:20:02Z","title":"Vision-and-Language Navigation for UAVs: Progress, Challenges, and a Research Roadmap","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-10T13:48:08.135538Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.13654"},"observation_digest":"sha256:0bc15f3b27c897ef312e7f4f1414d918e32dca74b41daa6a8b0c3696d46b3fe4","observation_id":"b4231c94-65a0-441e-9768-077b28e74bdf","resolution":{"observed_at":"2026-05-10T14:10:29.583446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.20347","last_updated":"2026-04-22T08:49:59Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:49:59Z","title":"A Vision-Language-Action Model for Adaptive Ultrasound-Guided Needle Insertion and Needle Tracking","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-10T00:30:41.056486Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.20347"},"observation_digest":"sha256:d6090bd277e4e648a9690572192ed675be86590a114562e8c3cfdd40c2c7da77","observation_id":"0f638935-696c-4643-9de1-e0b440644714","resolution":{"observed_at":"2026-05-11T13:46:05.822446Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.21453","last_updated":"2026-04-23T09:11:50Z","snapshot_observed_at":"2026-08-04T17:41:10.368554Z","submitted_at":"2026-04-23T09:11:50Z","title":"Instance-level Visual Active Tracking with Occlusion-Aware Planning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-09T21:59:52.919529Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.21453"},"observation_digest":"sha256:a81203a479371a627559c55e56007bc7ab371e5c3d5b77cf55f087dfb6517714","observation_id":"7a690784-0eed-4ee3-9c37-e882ca42bd36","resolution":{"observed_at":"2026-05-11T14:21:06.765783Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2604.24086","last_updated":"2026-04-27T06:20:15Z","snapshot_observed_at":"2026-08-03T03:51:20.015005Z","submitted_at":"2026-04-27T06:20:15Z","title":"AsyncShield: A Plug-and-Play Edge Adapter for Asynchronous Cloud-based VLA Navigation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T03:18:03.855477Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2604.24086"},"observation_digest":"sha256:321b4ae7b3011923b96b2c6074c48d54f61f9b3faf8436ec732d22b2c4a9bb4d","observation_id":"6b9ff224-0505-41b8-8885-1608585885f5","resolution":{"observed_at":"2026-05-11T22:11:13.698728Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2605.09005","last_updated":"2026-05-09T15:44:19Z","snapshot_observed_at":"2026-07-06T23:21:11.475005Z","submitted_at":"2026-05-09T15:44:19Z","title":"Towards Backdoor-Based Ownership Verification for Vision-Language-Action Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T02:29:34.973993Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2605.09005"},"observation_digest":"sha256:3d18fc414f32b394e218095e92f33e7b266d39fc11dddeff2e2ef9561a1d73cb","observation_id":"b24b29a8-cbe5-48f2-9093-f1162583b5bc","resolution":{"observed_at":"2026-05-12T07:36:36.447114Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2605.09441","last_updated":"2026-05-10T09:34:05Z","snapshot_observed_at":"2026-07-06T23:21:30.897592Z","submitted_at":"2026-05-10T09:34:05Z","title":"Beyond Isolation: A Unified Benchmark for General-Purpose Navigation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:53.557357Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2605.09441"},"observation_digest":"sha256:2e06a71be2cb79a58085f42860f9f5899695d1f519062d29dca9213b45f61525","observation_id":"b2bcdea1-b1eb-42bf-b2a4-0ddf44369665","resolution":{"observed_at":"2026-05-12T06:06:27.484646Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.01848","last_updated":"2026-06-01T07:59:54Z","snapshot_observed_at":"2026-08-07T09:33:36.870755Z","submitted_at":"2026-06-01T07:59:54Z","title":"RescueBench: Can Embodied Agents Save Lives in the Wild ?","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T15:09:47.385928Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.01848"},"observation_digest":"sha256:03abee4750ba013bc5a622b97e461c6f678d2ca1af6994106ce363e4ce217749","observation_id":"8b98d5ae-acfe-4943-aa94-6e98224540a2","resolution":{"observed_at":"2026-07-01T22:36:17.889175Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.03682","last_updated":"2026-06-02T14:05:47Z","snapshot_observed_at":"2026-07-06T23:43:55.632508Z","submitted_at":"2026-06-02T14:05:47Z","title":"GN0: Toward a Unified Paradigm for Generation, Evaluation, and Policy Learning in Visual-Language Navigation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T09:51:00.563422Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.03682"},"observation_digest":"sha256:a9a3dd9f48099ac1a41ea77c1ebad5df947b2847e94317482a02279960021f55","observation_id":"b8d4fec2-7f50-4e59-8008-70af2ecaaf02","resolution":{"observed_at":"2026-07-02T03:36:30.088455Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.18634","last_updated":"2026-06-17T03:04:11Z","snapshot_observed_at":"2026-08-05T23:12:48.371447Z","submitted_at":"2026-06-17T03:04:11Z","title":"EffiNav: Fusing Depth and Vision-Language for Efficient Object Goal Navigation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T21:04:00.821473Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.18634"},"observation_digest":"sha256:eb9951725d395f96cfca9e37e50fb7d46ad6ed48ecbbd875f40bc2c207adffb3","observation_id":"87180a65-f12d-4091-b43a-6604e00c386e","resolution":{"observed_at":"2026-07-04T00:39:17.014079Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":"2505.23189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-04T20:00:08.776707Z","title":"Dreamwalker: Mental planning for continuous vision-language navigation","venue":null,"work_id":"665dfd04-5f6b-4f78-a29a-677505f18c91","year":2025},"citing_paper":{"arxiv_id":"2606.25880","last_updated":"2026-06-24T14:25:05Z","snapshot_observed_at":"2026-07-07T00:00:17.090702Z","submitted_at":"2026-06-24T14:25:05Z","title":"USS: Unified Spatial-Semantic Prompts for Embodied Visual Tracking with Latent Dynamics Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-25T20:48:49.071281Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2606.25880"},"observation_digest":"sha256:09fdefba6f356d6474360d637eefc87fc52d137e265596d10d47bf7d43615578","observation_id":"f47d7f4d-b0e5-42b6-9abb-5a6ff24a7de3","resolution":{"observed_at":"2026-07-04T20:00:08.778367Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-07-14T12:10:21.115628Z","title":"Trackvla: Embodied visual tracking in the wild.arXiv preprint arXiv:2505.23189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-14T12:10:21.115628Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:4bf913798fade955edc9de542acd378886a48e4cdd24855b78afe114547e447b","observation_id":"3b4bac15-7f67-41b3-b05e-91caccd77ae1","resolution":{"observed_at":"2026-07-14T12:10:21.115628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T07:19:42.675991Z","title":"Trackvla: Embodied visual tracking in the wild.arXiv preprint arXiv:2505.23189, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.10383","last_updated":"2026-07-17T07:17:10Z","snapshot_observed_at":"2026-08-04T19:07:58.422812Z","submitted_at":"2026-07-11T16:21:03Z","title":"ABot-N1: Toward a General Visual Language Navigation Foundation Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-02T07:19:42.675991Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.10383"},"observation_digest":"sha256:06ac4cd9997f1df2570c241103d4b770a8eb715ddafd2d66bf49c3b9b325d752","observation_id":"d2a5e682-9c0f-4b86-b398-958e6ccf2a58","resolution":{"observed_at":"2026-08-02T07:19:42.675991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23189","snapshot_observed_at":"2026-08-02T04:42:02.888481Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.13621","last_updated":"2026-07-15T09:09:25Z","snapshot_observed_at":"2026-08-07T13:53:22.458398Z","submitted_at":"2026-07-15T09:09:25Z","title":"UESF-Bench: Benchmarking and Probing for Unified Embodied Seeking and Following","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T04:42:02.888481Z"},"links":{"cited_paper":"/paper/2505.23189","citing_paper":"/paper/2607.13621"},"observation_digest":"sha256:4b9138f2215bbda8032739b89ca9e4634bb8d9c98b7447d4a5cfd5623a2e716d","observation_id":"22f440c8-e916-41a7-acef-ced7cfedc286","resolution":{"observed_at":"2026-08-02T04:42:02.888481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2505.23189/citation-record","integrity":"/paper/2505.23189/integrity","json":"/paper/2505.23189/citation-record.json","paper":"/paper/2505.23189"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.986190Z","title":"Maalouf, N","venue":null,"work_id":"cba71977-d162-4c2d-93d3-d8c876cf73a3","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.058701Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:9a57abf1cfc237604cd59130cff206212cf662066399a27463c348e113a2f114","observation_id":"67481953-c0ab-4705-90d2-e3b441f68d32","resolution":{"observed_at":"2026-08-07T12:58:50.061813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.765716Z","title":"Zhang, K","venue":null,"work_id":"46812efe-ab12-4630-a69a-acef1ede1d1c","year":2018},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.131238Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:87514c3b0cb2b9f2827e7dcbb956a0b543f4b45dacc369ae17a4d95200ba8761","observation_id":"bce6bae7-59f1-4d3e-97cb-5d3b2d56bfa3","resolution":{"observed_at":"2026-08-07T12:58:49.899080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.497164Z","title":"Zhong, P","venue":null,"work_id":"345ed391-d068-42e5-891a-eca519d8d7d6","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.235735Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:ce02797c4610c9834b4ca82ec835c15906d2fa77a2dbf9c1ab3e3d9be7cdc762","observation_id":"167e268a-18d3-4122-afa2-632eb32f016f","resolution":{"observed_at":"2026-08-07T12:58:49.626602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:49.248517Z","title":"Zhong, P","venue":null,"work_id":"52019373-e3b3-41b9-9076-a9901f036097","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.356608Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4ff4fc69355c43f0582c1e8eb0f6cbd3d8ebe3c8eec06b7d8a0ac77026ca7cf3","observation_id":"c119d1d2-7fcf-4909-babc-5697ae04b213","resolution":{"observed_at":"2026-08-07T12:58:49.354620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.996054Z","title":"Zhong, X","venue":null,"work_id":"d1014d7b-3954-4888-bd37-1a7dc785821e","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.427961Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:10d115209b7dcc131eee6b61bedbfa047b2f69f3e5f7aaf15e0fa2383fbd42da","observation_id":"c0e1e35d-d048-4024-8de7-60c63a0d9297","resolution":{"observed_at":"2026-08-07T12:58:49.099697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.718231Z","title":"Zhong, K","venue":null,"work_id":"c4b97cf8-9a1d-4da5-ae0d-a7ee615b9d7d","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.532878Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:0467a83cfb8979d2071c51faa1741863df612aef6a34a6bc3e1f478aeabbca74","observation_id":"c5d54fcf-28db-44df-9eec-2555f756f697","resolution":{"observed_at":"2026-08-07T12:58:48.846902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.493602Z","title":null,"venue":null,"work_id":"7fac3892-b8ec-4857-ac11-8f238e02d62d","year":2022},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.659436Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:fff8ca8c5153aa09e474003d1194cc602fb9e80874340d71d7ca1ab2d3501a6b","observation_id":"70bdd799-bade-4a62-bc72-6b0189b2f2ca","resolution":{"observed_at":"2026-08-07T12:58:48.605280Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:35.774363Z","title":"Mavrogiannis, F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.774363Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:483692ca527b8be548407bd3437b2c8d2372e60837ec2d4948ebc3393d3163c0","observation_id":"f8f0b71a-439f-4a7f-89d3-2a8eaf70af1a","resolution":{"observed_at":"2026-08-07T12:58:35.774363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.13724","last_updated":"2023-10-19T17:29:17Z","snapshot_observed_at":"2026-08-02T17:55:38.209254Z","submitted_at":"2023-10-19T17:29:17Z","title":"Habitat 3.0: A Co-Habitat for Humans, Avatars and Robots","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.13724","snapshot_observed_at":"2026-08-07T12:58:35.889780Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:35.889780Z"},"links":{"cited_paper":"/paper/2310.13724","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a0dd174574a92f92651d7b3703a1bf58f36a2dd914b01bc22fd51df344b4ec0b","observation_id":"2dd1e57f-afa4-46bb-ac73-d868f99d3119","resolution":{"observed_at":"2026-08-07T12:58:35.889780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.268644Z","title":null,"venue":null,"work_id":"20095eec-51ac-40f4-a063-9cf550e729d3","year":2020},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.000986Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:6487c6055dd1fb85090bbd63c4214307138404a03a43fbe26463389d0521f5cb","observation_id":"a4db9c36-f856-4adb-9be4-a5f155b9f8a6","resolution":{"observed_at":"2026-08-07T12:58:48.350545Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:36.146071Z","title":"Kirillov, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.146071Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8e3c997cc5842f35fd980a527a3651835ee9138faa5d38418104a90434e8de7d","observation_id":"45b2709a-60f8-4d37-a393-d6844d5530d5","resolution":{"observed_at":"2026-08-07T12:58:36.146071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00714","last_updated":"2024-10-28T16:37:57Z","snapshot_observed_at":"2026-07-06T18:55:41.459417Z","submitted_at":"2024-08-01T17:00:08Z","title":"SAM 2: Segment Anything in Images and Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00714","snapshot_observed_at":"2026-08-07T12:58:36.223357Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.223357Z"},"links":{"cited_paper":"/paper/2408.00714","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5081f94054bb3b546da1357e970f0e2dcab0af80eb9c41a77a20fb0d15a1befd","observation_id":"814f903b-9094-45e3-bbd1-f4fd3ed4ab28","resolution":{"observed_at":"2026-08-07T12:58:36.223357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.05499","last_updated":"2024-07-19T06:00:41Z","snapshot_observed_at":"2026-07-06T15:00:58.804337Z","submitted_at":"2023-03-09T18:52:16Z","title":"Grounding DINO: Marrying DINO with Grounded Pre-Training for Open-Set Object Detection","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.05499","snapshot_observed_at":"2026-08-07T12:58:36.327498Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.327498Z"},"links":{"cited_paper":"/paper/2303.05499","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:999df9fc17d8019725f047d73d1d711ec09d0d55f590cb9d37642e4682cf6131","observation_id":"e5a63d46-9c64-4d15-8181-7664728f4f3f","resolution":{"observed_at":"2026-08-07T12:58:36.327498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-08-06T17:32:08.916929Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06224","snapshot_observed_at":"2026-08-07T12:58:36.395247Z","title":"Zhang, K","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.395247Z"},"links":{"cited_paper":"/paper/2412.06224","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:d5d142cba8177458d8183ed6fe09ed405a152a3045ef3de9e55a7c237ea7f0d6","observation_id":"00f011fa-18c9-4161-a456-8490f1071e24","resolution":{"observed_at":"2026-08-07T12:58:36.395247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:48.094849Z","title":null,"venue":null,"work_id":"84f47f7a-9751-4123-ad39-7cf77d4ed497","year":2018},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.461897Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:e7c98fad86ca802a55eb327fc7cf91fba8a9fd770d75eac45cd58209c43b050d","observation_id":"2033133c-7dfe-4cdc-a7b0-d597a2ce5187","resolution":{"observed_at":"2026-08-07T12:58:48.147958Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.959038Z","title":null,"venue":null,"work_id":"6f1ac0b4-200b-480a-9b91-b7754da7d96a","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.536447Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5d3b950e68cdc689757629dbfae15efcd8f4582a3c6831bc4e6a1ebf69c88a1d","observation_id":"76ec1028-595e-49aa-bcfd-a68e61ed2ea5","resolution":{"observed_at":"2026-08-07T12:58:48.016695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.761757Z","title":null,"venue":null,"work_id":"8a448043-0eee-46fa-8f99-7de2369f5a72","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.629184Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:d3639cbbeb6a78b5a2e943daa88d0a225fdee7cd580ae5f62f7d49be436915e7","observation_id":"b20a0d8c-f145-4326-bda7-06a9cbd5b1af","resolution":{"observed_at":"2026-08-07T12:58:47.847534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.555152Z","title":null,"venue":null,"work_id":"fa1dae56-7817-45a2-bab3-36514ae61588","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.817160Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:0f3fb367b62a852e6c1f9f0ec3488e5a1e680e9e58fb991d4cade1580d12019e","observation_id":"93a09a66-45c8-45f8-9e5e-46eac056ca90","resolution":{"observed_at":"2026-08-07T12:58:47.635265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.424721Z","title":null,"venue":null,"work_id":"b1da42b0-4e1c-4168-b072-8e40250749c5","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:36.883788Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:97a2b47496030a4a91c19d31305da0dc32e61cdf977116432d49ae4e92f3eca3","observation_id":"94df9ac8-0547-4929-9a07-6d5b50d37340","resolution":{"observed_at":"2026-08-07T12:58:47.476954Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.292903Z","title":null,"venue":null,"work_id":"d29cab7b-142e-41d7-8ba4-354bb79ba339","year":2017},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.021221Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:6e5b5c199526dc1d084671c022d843c80b4286176ddcaa9f622fbcac7145399d","observation_id":"7b9327f9-d24f-49cc-8b45-4e077d8e6fc3","resolution":{"observed_at":"2026-08-07T12:58:47.357975Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:47.099458Z","title":null,"venue":null,"work_id":"44b8ccf1-1389-4bfe-88dc-2656e7d34d22","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.097522Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:2a9d6ebf8cd576f0b4ad981eb9904fef52fbf547e68485fdaf7cdbb6e27cab3a","observation_id":"94bc2483-7021-4e4e-808b-5e0031e1aa55","resolution":{"observed_at":"2026-08-07T12:58:47.157662Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02188","last_updated":"2025-07-11T07:24:03Z","snapshot_observed_at":"2026-08-07T17:31:52.900631Z","submitted_at":"2025-03-04T01:50:50Z","title":"RPF-Search: Field-based Search for Robot Person Following in Unknown Dynamic Environments","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02188","snapshot_observed_at":"2026-08-07T12:58:37.240873Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.240873Z"},"links":{"cited_paper":"/paper/2503.02188","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:216642ab1cac7a0e9343897b9e3221e0d7825a87c2f2cb4e4d4ac9aea562b6ef","observation_id":"f9251d7e-0879-4db2-928d-aaba4782bc68","resolution":{"observed_at":"2026-08-07T12:58:37.240873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:37.352623Z","title":"Francis, C","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.352623Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:401b5d888513ebc609ae20e7e2efca77f19209a4ee7a49fe3774fb3f6ce07446","observation_id":"a94a2cb8-6546-449e-9f47-6083fc7b0fae","resolution":{"observed_at":"2026-08-07T12:58:37.352623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.965712Z","title":null,"venue":null,"work_id":"b95ae108-38fa-484e-acf9-4dd455d507d3","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.461397Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:6c24ea1d1c8e5a1611aa68ff706e68a2f59387f1ccd867ec1d1adae698051fb2","observation_id":"e0bf8ac8-f1af-4e2a-abd3-c8c432ae9996","resolution":{"observed_at":"2026-08-07T12:58:47.025330Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.846117Z","title":null,"venue":null,"work_id":"fc6fc405-c5bc-405e-93ac-df7316701f9f","year":2021},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.555731Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a09ddecddf08bb06ecda30c94f1228f4cadcf81595b29d7f573b193ce92d1a3c","observation_id":"98e6817b-5959-48f0-98ae-d6462869ff77","resolution":{"observed_at":"2026-08-07T12:58:46.889131Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20083","last_updated":"2024-06-28T17:51:10Z","snapshot_observed_at":"2026-07-06T18:38:38.104034Z","submitted_at":"2024-06-28T17:51:10Z","title":"PoliFormer: Scaling On-Policy RL with Transformers Results in Masterful Navigators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20083","snapshot_observed_at":"2026-08-07T12:58:37.641043Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.641043Z"},"links":{"cited_paper":"/paper/2406.20083","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:104b8c1b0a80fdaf83f693cbbdfbe35e57dda65fa9ffd6f8697c72be2ff2c82e","observation_id":"973b0c07-589c-45e7-b8c3-0ebac85911ba","resolution":{"observed_at":"2026-08-07T12:58:37.641043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.738393Z","title":"Zhong, P","venue":null,"work_id":"090ce992-6971-4ec6-a5dd-774541d1a448","year":2021},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.703557Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:452a09963665adcd5ae6a5d1c818048651a99c1ccc935108e0afe2b7da4fbf0c","observation_id":"0d041274-f3c7-473b-892a-c2c666441e32","resolution":{"observed_at":"2026-08-07T12:58:46.791681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.615486Z","title":"Bajcsy, A","venue":null,"work_id":"e054a9e0-208a-4fb4-9c03-832d4e6c53c6","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.791581Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:9e8a5a38ada4a1611d2c9fe9d233134f231f31b7b2be178563553338f9a443fd","observation_id":"3be7ec5f-286d-4b2b-a1d1-7e99f30633c4","resolution":{"observed_at":"2026-08-07T12:58:46.687855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.11327","last_updated":"2025-02-25T10:43:21Z","snapshot_observed_at":"2026-08-04T18:53:58.255463Z","submitted_at":"2024-04-17T12:39:48Z","title":"Following the Human Thread in Social Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.11327","snapshot_observed_at":"2026-08-07T12:58:37.879218Z","title":"Scofano, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:37.879218Z"},"links":{"cited_paper":"/paper/2404.11327","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:374f71f1dfa416c93b48d875d41488d07001ca7911c1be4d26ec77f33fbe20ac","observation_id":"46c87dae-cf6b-4496-87e6-45fcc7596da8","resolution":{"observed_at":"2026-08-07T12:58:37.879218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08244","last_updated":"2022-12-16T02:23:50Z","snapshot_observed_at":"2026-08-09T10:12:19.914051Z","submitted_at":"2022-12-16T02:23:50Z","title":"Offline Reinforcement Learning for Visual Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08244","snapshot_observed_at":"2026-08-07T12:58:38.012651Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.012651Z"},"links":{"cited_paper":"/paper/2212.08244","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:3524388931fc0e38bd1ff7d829945b04a24efaaa5b9ab896515e6b7cd6aa8db0","observation_id":"7f970009-1128-4408-9501-906b06231edd","resolution":{"observed_at":"2026-08-07T12:58:38.012651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07035","last_updated":"2024-12-29T23:16:37Z","snapshot_observed_at":"2026-07-06T18:43:47.559289Z","submitted_at":"2024-07-09T16:53:36Z","title":"Vision-and-Language Navigation Today and Tomorrow: A Survey in the Era of Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07035","snapshot_observed_at":"2026-08-07T12:58:38.102288Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.102288Z"},"links":{"cited_paper":"/paper/2407.07035","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:c0306754b9d67e8d94c5747f8d6334d665002d828df22f3b922702740cbfc66a","observation_id":"f52b4969-3e3e-4dc2-80b4-3007facd5bee","resolution":{"observed_at":"2026-08-07T12:58:38.102288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.419447Z","title":null,"venue":null,"work_id":"4690ef91-155f-451b-8f57-e6cda7dedcca","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.181091Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:db9d75af94abfa6d2450082ef7e6e0990b0344d3820376737680f00d66b401e6","observation_id":"70b38732-60a4-468e-9e1f-eb61ca4d77cc","resolution":{"observed_at":"2026-08-07T12:58:46.500788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:38.344919Z","title":"Sridhar, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.344919Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4f3596026c1c2c3d881e6cfa2f57a336d64b7ca6a726a918f36935c10d31528e","observation_id":"b5404f59-c1c3-45be-aa1a-e93d5c4e3a8f","resolution":{"observed_at":"2026-08-07T12:58:38.344919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04882","last_updated":"2024-06-07T12:26:34Z","snapshot_observed_at":"2026-08-07T05:10:17.561481Z","submitted_at":"2024-06-07T12:26:34Z","title":"InstructNav: Zero-shot System for Generic Instruction Navigation in Unexplored Environment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04882","snapshot_observed_at":"2026-08-07T12:58:38.413065Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.413065Z"},"links":{"cited_paper":"/paper/2406.04882","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:762406b653c5984edb8c6066190487a666e6312d409daad5e83a07090cc8723b","observation_id":"00b0659e-6271-4403-99f3-5ecae9128e10","resolution":{"observed_at":"2026-08-07T12:58:38.413065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:38.517526Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.517526Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:511de0f05a98f11a308640e4029dfc9e69925afcaa4393c817e4df86a242cbc6","observation_id":"43a840bc-129a-4654-9665-11307f1fba6c","resolution":{"observed_at":"2026-08-07T12:58:38.517526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.227276Z","title":"Zhang, K","venue":null,"work_id":"07aa02c6-b538-4928-b847-3658118978d3","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.614594Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:e0e89695d0b807bc285902a4f05fa7118c170cf7f128e70c9fb2bb518ee7c0f6","observation_id":"059052d0-e70f-469e-95aa-0d2ec8de704d","resolution":{"observed_at":"2026-08-07T12:58:46.319117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:46.029262Z","title":null,"venue":null,"work_id":"2da0cd13-07d9-4527-9b77-5024158b6f4b","year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.677358Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b04eb13fc5faf1b12ba8e5b6d29ad68c8099508273b955a78b85dfdc868590e4","observation_id":"ef43213a-6963-45f5-83ca-bc9cf6fc1450","resolution":{"observed_at":"2026-08-07T12:58:46.118126Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.10670","last_updated":"2024-03-25T02:52:43Z","snapshot_observed_at":"2026-08-07T23:58:33.608848Z","submitted_at":"2024-02-16T13:21:33Z","title":"OpenFMNav: Towards Open-Set Zero-Shot Object Navigation via Vision-Language Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.10670","snapshot_observed_at":"2026-08-07T12:58:38.760960Z","title":"Kuang, H","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.760960Z"},"links":{"cited_paper":"/paper/2402.10670","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:27b3377cb5116f5160bdf20c1c132c0bf79806de497db86ef6f11b5f43bdac2d","observation_id":"0bde81c7-3733-44d4-bb2f-627c86405e6c","resolution":{"observed_at":"2026-08-07T12:58:38.760960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.844343Z","title":null,"venue":null,"work_id":"c87787aa-7268-4b10-8353-6f6436762e94","year":2020},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.803361Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:96daad3d16ed56917a4d07d376faf746a2ab3fe07c0b3269f8f5adc5b9493256","observation_id":"68ba1362-42aa-44d0-a812-70013e0e1549","resolution":{"observed_at":"2026-08-07T12:58:45.934456Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.707583Z","title":"Zhang, L","venue":null,"work_id":"2bbea73b-5d1b-41d9-a21c-9c191410ce22","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.869797Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:34f24fcb952e3fea50ff50a324b05db0134a571e7c02065c95a4512a059c17d1","observation_id":"128cc425-3022-4d5d-82ae-1c8957a5bcd1","resolution":{"observed_at":"2026-08-07T12:58:45.783363Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10439","last_updated":"2025-08-28T04:36:42Z","snapshot_observed_at":"2026-08-07T23:58:35.215663Z","submitted_at":"2024-12-11T09:50:35Z","title":"CogNav: Cognitive Process Modeling for Object Goal Navigation with LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10439","snapshot_observed_at":"2026-08-07T12:58:38.925304Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:38.925304Z"},"links":{"cited_paper":"/paper/2412.10439","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:010063d18ef73718028df09623d354edce4940bdf7945cde3e632969b533a83d","observation_id":"ca8eb7ab-87a8-489a-9434-e4c0774b1bb2","resolution":{"observed_at":"2026-08-07T12:58:38.925304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.504313Z","title":null,"venue":null,"work_id":"4660a5f4-449f-4daf-8641-23c2ad0db056","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.019452Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:64662e03743049bd75257e78916d8b136061e02715f03dfed0cb0931cbb84bac","observation_id":"8db9370e-1b6d-4ca8-a5e0-96a1b41d9d54","resolution":{"observed_at":"2026-08-07T12:58:45.627534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.301572Z","title":"Majumdar, A","venue":null,"work_id":"2ff9a272-7834-4dac-9fcc-7e27968e0944","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.072734Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a92a629550356bcc3673c1fdfab339ee69d6122c19f639e36bba93d5b6fbbbac","observation_id":"35170037-d108-43d5-b610-ad000c2694b9","resolution":{"observed_at":"2026-08-07T12:58:45.378228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T12:58:39.143715Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.143715Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b6e27645ef0a46f7e27a161537acd2264a1097c15abf710b80e792b83859b6d9","observation_id":"d7466e2c-98a5-4d64-bdb4-24e401133135","resolution":{"observed_at":"2026-08-07T12:58:39.143715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17434","last_updated":"2024-10-22T21:21:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-22T21:21:37Z","title":"LongVU: Spatiotemporal Adaptive Compression for Long Video-Language Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17434","snapshot_observed_at":"2026-08-07T12:58:39.212127Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.212127Z"},"links":{"cited_paper":"/paper/2410.17434","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:1fc78ab4583a25e43d803a1c4d37c504e41b9557e7324f5da3b3bb37c79dfaae","observation_id":"3f0a2539-0a59-47c3-b529-864aca2d780b","resolution":{"observed_at":"2026-08-07T12:58:39.212127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-07T12:58:39.273900Z","title":"Steiner, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.273900Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:cc9c83bd3d1b4b03968fc65d4b15fbb56f74399ad33ece05a89371c7cb734db6","observation_id":"61c62a60-7bad-498e-93ea-26cb7a25b2c1","resolution":{"observed_at":"2026-08-07T12:58:39.273900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.170677Z","title":"Chiang, Z","venue":null,"work_id":"5456fb3f-af37-4700-a817-436277c769fe","year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.346763Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4cefbc9cded733064f0ea386f2b77310ccfdc54c15ed83589761f120846521d7","observation_id":"eefd5949-13c3-46c2-9ecb-f248b364e746","resolution":{"observed_at":"2026-08-07T12:58:45.239849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T12:58:39.423884Z","title":"Black, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.423884Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a8ac454092ec84ea5825763087fbf80681dd3b56ce5f63997d56286fa152dbac","observation_id":"987a77e5-4c63-45fd-8676-92a00c4d6878","resolution":{"observed_at":"2026-08-07T12:58:39.423884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16054","last_updated":"2025-04-22T17:31:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-22T17:31:29Z","title":"$\\pi_{0.5}$: a Vision-Language-Action Model with Open-World Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16054","snapshot_observed_at":"2026-08-07T12:58:39.473566Z","title":"Intelligence, K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.473566Z"},"links":{"cited_paper":"/paper/2504.16054","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:eae8a17ef97dc989e8401fddb6e488e9df75101d37eda9c57b65359fd02ba0cf","observation_id":"c7f81765-a013-4f17-9a96-3927133eb0ac","resolution":{"observed_at":"2026-08-07T12:58:39.473566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T12:58:39.575909Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.575909Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8ef81ab3b338349d39f23d0445f896745f2c1c49fe655aa71df2aae96bf9037a","observation_id":"ef87750d-900c-4777-8110-ae6ee805554c","resolution":{"observed_at":"2026-08-07T12:58:39.575909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T12:58:39.658118Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.658118Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:5b968d05331bd813b3a75a577facb613f019baf603c2173fe9d1f51c4f305fd3","observation_id":"23f80d29-2aab-489f-b190-533f5898ba74","resolution":{"observed_at":"2026-08-07T12:58:39.658118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15830","last_updated":"2025-05-19T02:40:18Z","snapshot_observed_at":"2026-07-06T20:26:31.558337Z","submitted_at":"2025-01-27T07:34:33Z","title":"SpatialVLA: Exploring Spatial Representations for Visual-Language-Action Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15830","snapshot_observed_at":"2026-08-07T12:58:39.726418Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.726418Z"},"links":{"cited_paper":"/paper/2501.15830","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:041e34a64f0ed5b018463d5fd386cdb1087ae589e22b079f1d92978193f507f4","observation_id":"6dba593b-bed5-4fcb-a08c-6711ab797c4f","resolution":{"observed_at":"2026-08-07T12:58:39.726418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:39.807440Z","title":"Zhong, X","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.807440Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f8210edde2028b5f9bd4b0a9fc31c69a94bbc825db286f0a75eb889c8af6b512","observation_id":"3d13b2f2-ffc5-417a-a106-5565a93f9ecb","resolution":{"observed_at":"2026-08-07T12:58:39.807440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:39.872635Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.872635Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a3299bd96021d9c4f270f187b7de233b8332011eaba357e8436235e81743b348","observation_id":"cb4e414b-ccf3-43fe-bc12-a987a96199c0","resolution":{"observed_at":"2026-08-07T12:58:39.872635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04453","last_updated":"2025-02-17T18:27:27Z","snapshot_observed_at":"2026-08-03T17:33:16.283221Z","submitted_at":"2024-12-05T18:58:17Z","title":"NaVILA: Legged Robot Vision-Language-Action Model for Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04453","snapshot_observed_at":"2026-08-07T12:58:39.930337Z","title":"Cheng, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:39.930337Z"},"links":{"cited_paper":"/paper/2412.04453","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:94b4c1c94844411ecf9adce92329f15f05fcd7d46000474a0de9a069614b7685","observation_id":"2eef2a0e-9ef3-4ab0-ba8c-0c7f41be2c87","resolution":{"observed_at":"2026-08-07T12:58:39.930337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17043","last_updated":"2023-11-28T18:53:43Z","snapshot_observed_at":"2026-08-06T05:08:17.428238Z","submitted_at":"2023-11-28T18:53:43Z","title":"LLaMA-VID: An Image is Worth 2 Tokens in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17043","snapshot_observed_at":"2026-08-07T12:58:40.004022Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.004022Z"},"links":{"cited_paper":"/paper/2311.17043","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:b5746590012266ce56186635552f57142c53881c68624a242c383232102689a5","observation_id":"c4fe22d9-0890-46e7-b489-e5439882b89b","resolution":{"observed_at":"2026-08-07T12:58:40.004022Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-07T12:58:40.054250Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.054250Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:e886a431b98fca42b4bff070f012ce655cde23e624ff0a6c2b32c3e8cfc5eaa7","observation_id":"ac34de30-2665-4837-8271-6b3539649af7","resolution":{"observed_at":"2026-08-07T12:58:40.054250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:40.121508Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.121508Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:49c2de09104a9dc0b6989435f1159ba7884e386872f7fe7cb322229d5635d824","observation_id":"2dd17f25-dd67-4453-8790-fadbd5295fb1","resolution":{"observed_at":"2026-08-07T12:58:40.121508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T12:58:40.203234Z","title":"Touvron, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.203234Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:91b38faf26f9f247b2257f7c14174b240d62c4c2427d66a6a87455b117304ffe","observation_id":"450dd411-5237-4bb9-8279-482a9f1e9259","resolution":{"observed_at":"2026-08-07T12:58:40.203234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15139","last_updated":"2025-04-10T08:48:37Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:59:47Z","title":"DiffusionDrive: Truncated Diffusion Model for End-to-End Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15139","snapshot_observed_at":"2026-08-07T12:58:40.270249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.270249Z"},"links":{"cited_paper":"/paper/2411.15139","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:61f4f723c621572ebdcb678c93b08ac3e2561cdf04d1b8fa750eaf1894594f61","observation_id":"3d526d48-951c-4487-81cc-ee78e9232f46","resolution":{"observed_at":"2026-08-07T12:58:40.270249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:40.324143Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.324143Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:a2b5555ff7f5e03a0ff2cb6946b7bfcec9db15f068a10499be6e9ff49f6756f9","observation_id":"9d40dce9-d2fa-4bbb-9a5e-c246e7b95ef8","resolution":{"observed_at":"2026-08-07T12:58:40.324143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:45.005697Z","title":"Arthur and S","venue":null,"work_id":"f5b8a527-58e0-4f50-a1a1-82beff3d28f1","year":2006},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.410581Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:204fb6e5abce30864d602a65824718bda7f07f50e3538bd3a91e88e80bb75b71","observation_id":"af296696-0ec6-479b-9eda-c54bf51d50dc","resolution":{"observed_at":"2026-08-07T12:58:45.063738Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:40.497523Z","title":"Peebles and S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.497523Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:3b0dbed323c6de85c2f9861ce06b17774b5e322a6f40211ae2cd591ebfcccc2e","observation_id":"85e36d22-beb4-45f9-8498-3d9f200aef05","resolution":{"observed_at":"2026-08-07T12:58:40.497523Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02502","last_updated":"2022-10-05T20:19:21Z","snapshot_observed_at":"2026-07-06T10:01:50.133383Z","submitted_at":"2020-10-06T06:15:51Z","title":"Denoising Diffusion Implicit Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.02502","snapshot_observed_at":"2026-08-07T12:58:40.581911Z","title":null,"venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.581911Z"},"links":{"cited_paper":"/paper/2010.02502","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8f50abc3d156676ff6e79c67f6e36afa04c44bb4e470286b9cf9271fc3ed2f04","observation_id":"cf139da7-68ba-49dd-8ed3-833707332c80","resolution":{"observed_at":"2026-08-07T12:58:40.581911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.775759Z","title":null,"venue":null,"work_id":"4ba73835-74f0-42c5-a10c-13c338d23bcf","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.710904Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:f1419ed22a4706ecaf4b0d28a64be0dea636a55df83afc625df9f4c1aab1ff91","observation_id":"b22a0d28-0fe7-46c3-9acc-7a2c2d27dc4e","resolution":{"observed_at":"2026-08-07T12:58:44.894076Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T12:58:40.830606Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.830606Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:c1f402356867c2fa40fd5a1e61d871eac91ea44ca398bbabeceb31b80c4f0a3f","observation_id":"97c1ce9a-0c23-4bb7-8ba8-633845b975bd","resolution":{"observed_at":"2026-08-07T12:58:40.830606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.533261Z","title":null,"venue":null,"work_id":"58f4dba6-afad-4d79-b8c8-03f08b1fb045","year":1996},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:40.961887Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:8d65a98f6bff9550c7c93396e426fb054b7ed89aa55d8b4441b5e34a37740a91","observation_id":"68a8a07a-746c-43a3-98d0-d60e62ba774e","resolution":{"observed_at":"2026-08-07T12:58:44.668102Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.377582Z","title":"Van Den Berg, S","venue":null,"work_id":"448038a4-f060-4296-b45c-9e012afaea34","year":2011},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.044804Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:66eea109e543fb2d5a5ff2ac6380f07d45dd1593849e6b7d43c438edcb087acd","observation_id":"82b1bb3b-8cf9-4cd6-941f-2e0174b9bcad","resolution":{"observed_at":"2026-08-07T12:58:44.445025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.205113Z","title":null,"venue":null,"work_id":"b90c924c-963e-4972-a234-dcc4da4efdd6","year":2021},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.086656Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:eb0f22b96933536b9ee5b79f01778dbefb6e7b16b7179ed952fc0b749c81ca57","observation_id":"67eaf00b-20c5-4ba1-a2ba-b3fad4da9c94","resolution":{"observed_at":"2026-08-07T12:58:44.302312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:44.008073Z","title":"Chang, A","venue":null,"work_id":"4f2c7e4e-a7df-48bb-860a-961449a25071","year":2017},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.214814Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:1fbfc6b3dcd3c143caa2ec27144c1ea3835682bd6dc58077822cf14c1234687b","observation_id":"3de6fbdb-c3b3-4a54-9a0d-329283adae80","resolution":{"observed_at":"2026-08-07T12:58:44.127299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.862037Z","title":"Gupta, S","venue":null,"work_id":"7ee77ee5-e526-4734-8d89-92d7ed980d24","year":2016},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.355498Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:79bcbc6765c96139bfc7117ea71ead39bc089647a1e3672a3aa893079d466652","observation_id":"7cff437e-7533-4b66-90d9-d198656493e5","resolution":{"observed_at":"2026-08-07T12:58:43.945533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.679329Z","title":null,"venue":null,"work_id":"908b405e-27e7-43b9-9df0-a3f1c1eda813","year":2019},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.423043Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:1e9cb5b013af00ed07b60579020cf6246dc0176aeeaf3942dcdb8a9a9491bb7c","observation_id":"94c65041-bf1c-4d84-8643-a1e34c1c11da","resolution":{"observed_at":"2026-08-07T12:58:43.785527Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T12:58:41.502809Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.502809Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:4eb705cd8453645b0b71d3d4e8b8b51d10c9405333c7f48fe4c3f300dff73d73","observation_id":"6bafc13e-1494-4da1-ba53-7a34198f855c","resolution":{"observed_at":"2026-08-07T12:58:41.502809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.464211Z","title":"Introducing 4o image generation","venue":null,"work_id":"a5dbccf5-11e2-4f92-a370-d9af71090f14","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.566176Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:bdaa4c77f4984e0326d22d2314531ca9f5ed307f420e48b4598804b7a6e3b226","observation_id":"acdf7f22-24f3-4123-9275-65a081a6be1d","resolution":{"observed_at":"2026-08-07T12:58:43.564083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.08507","last_updated":"2025-05-12T02:14:50Z","snapshot_observed_at":"2026-08-07T17:12:44.716807Z","submitted_at":"2025-03-11T14:57:14Z","title":"Referring to Any Person","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.08507","snapshot_observed_at":"2026-08-07T12:58:41.700139Z","title":"Jiang, L","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.700139Z"},"links":{"cited_paper":"/paper/2503.08507","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:402dce99e87b93e923f5d6f2728d7d4d48ca78c6d4c39c8cdf28ca806abd61a1","observation_id":"bb24df26-8897-467f-9d56-b6617fd084c8","resolution":{"observed_at":"2026-08-07T12:58:41.700139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.17240","last_updated":"2024-01-22T06:53:23Z","snapshot_observed_at":"2026-07-31T19:08:37.289553Z","submitted_at":"2023-12-28T18:58:33Z","title":"LISA++: An Improved Baseline for Reasoning Segmentation with Large Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.17240","snapshot_observed_at":"2026-08-07T12:58:41.794743Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.794743Z"},"links":{"cited_paper":"/paper/2312.17240","citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:623e368ed2207c9bed0dc622fabafe886cd0ffe29bf3a53f9b429b29331dbbe8","observation_id":"c5744de0-5db0-4b55-8d63-9d2eaea7ad2f","resolution":{"observed_at":"2026-08-07T12:58:41.794743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.267342Z","title":"Misra, A","venue":null,"work_id":"06d7d4ec-3f18-4173-9c29-c8322d15822a","year":2016},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.853680Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:0e3e40d99bec6a75f82f9a96ce19e2ea612dfd2b0787770cb54d808818f53e2b","observation_id":"367ddb80-e21e-4b16-9b27-ec44d60e240a","resolution":{"observed_at":"2026-08-07T12:58:43.358602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:43.087411Z","title":"Zheng, S","venue":null,"work_id":"132aa3e7-1de8-45da-bd0e-999232cb0405","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:41.993958Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:2708c2752240af307f443a76fbbd20c229ccdd5857e932b2685ff11fc0565365","observation_id":"f9766b48-3adb-464c-8d25-642669e61123","resolution":{"observed_at":"2026-08-07T12:58:43.151631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:42.934944Z","title":null,"venue":null,"work_id":"c53d4a00-bd06-4a27-8156-a156d341dd9f","year":2025},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:42.108019Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:634c1356df318180a70f2baa5015f7917475002dd8a420e7291e496423aeec8b","observation_id":"026bfeb0-5807-4aa1-bf08-80c1d41d71fd","resolution":{"observed_at":"2026-08-07T12:58:43.011733Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:58:42.712475Z","title":"Follow the first person you see","venue":null,"work_id":"c0bab5be-2207-4848-a465-1741304f2c1e","year":2024},"citing_paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T12:58:42.191931Z"},"links":{"citing_paper":"/paper/2505.23189"},"observation_digest":"sha256:9e74412668282c58a7f732342831ba06e4598d2abfb05b3eb3c6e65904dd0d56","observation_id":"825d91eb-cafc-429c-84de-4c51c9489f29","resolution":{"observed_at":"2026-08-07T12:58:42.802533Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.23189","last_updated":"2025-05-29T07:28:09Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-08T12:16:21.532220Z","submitted_at":"2025-05-29T07:28:09Z","title":"TrackVLA: Embodied Visual Tracking in the Wild"},"reference_resolution":{"displayed":80,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":80},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 80 of 80 outbound references and 17 inbound Pith citation observations for arXiv:2505.23189."}