{"as_of":"2026-08-22T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2aa24e095cf7566bcb0ee51e576864802dcfa3ad8bde31584ab0077534156346","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:08:24.264448Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01535/citation-record","integrity":"/paper/2608.01535/integrity","json":"/paper/2608.01535/citation-record.json","paper":"/paper/2608.01535"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:30.850959Z","title":"Simlingo: Vision-only closed-loop autonomous driving with language- action alignment,","venue":null,"work_id":"8ba632e4-6fb3-490a-a63f-71e88c227294","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:19.929727Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:c00deda99b71638f5db5467a30552d57fd5d5140fdd5ad9c68417412bf646e56","observation_id":"ef47c185-c072-4157-a57e-beae37c3b550","resolution":{"observed_at":"2026-08-06T00:08:30.927554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13757","last_updated":"2025-11-05T23:46:20Z","snapshot_observed_at":"2026-08-14T00:40:02.694887Z","submitted_at":"2025-06-16T17:58:50Z","title":"AutoVLA: A Vision-Language-Action Model for End-to-End Autonomous Driving with Adaptive Reasoning and Reinforcement Fine-Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13757","snapshot_observed_at":"2026-08-06T00:08:20.069331Z","title":"Autovla: A vision-language-action model for end-to-end autonomous driving with adaptive reasoning and reinforcement fine-tuning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.069331Z"},"links":{"cited_paper":"/paper/2506.13757","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:0affe4897d926987733405b4408b65c2acdd15b6a465171cbdad183d1a101034","observation_id":"aca5813b-c007-4a50-a17c-efda5e492cd9","resolution":{"observed_at":"2026-08-06T00:08:20.069331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:30.610880Z","title":"Spatialvlm: Endowing vision-language mod- els with spatial reasoning capabilities,","venue":null,"work_id":"638edcb0-95c7-4015-a682-6c59216eab76","year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.206442Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:0f85c640e46f387fe833ac5b840699de565e5fc948e43ff7cf8b5ba0b4fe7651","observation_id":"9a20e5c5-b8b1-4974-bb6c-9cd5875a6892","resolution":{"observed_at":"2026-08-06T00:08:30.714894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:30.380695Z","title":"Robospatial: Teaching spatial understanding to 2d and 3d vision-language models for robotics,","venue":null,"work_id":"61e5a680-9aae-4d72-97de-2d6e9deb4c4d","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.303471Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:6c63088ca597c72fe0d228e8ba1b8d08840e450f989f9ce794d3aec3383de015","observation_id":"df765ff2-5d1d-459c-be46-7a256102a96b","resolution":{"observed_at":"2026-08-06T00:08:30.485101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:30.180916Z","title":"Vlm4d: Towards spatiotemporal awareness in vision language models,","venue":null,"work_id":"a9522d05-d6af-4534-8973-bd47ca11316e","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.400291Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:837b9b527fa55f4e55f34bd073695f338fc42a5b2365fefa380bf693c5a40a8d","observation_id":"27114329-a6fc-4fd3-b11a-aa1de136ed16","resolution":{"observed_at":"2026-08-06T00:08:30.294456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:20.507532Z","title":"Depthlm: Metric depth from vision language models,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.507532Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:5bd7ec129a48e5c722ec526c5f85a8e2239e50288956b3a7e799868d91f6d57c","observation_id":"a579b2c8-45a2-4007-8703-423141e92e05","resolution":{"observed_at":"2026-08-06T00:08:20.507532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:29.923673Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control,","venue":null,"work_id":"ea6363c3-43f6-4915-b7ac-e567e9b70af2","year":2023},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.673922Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:d91fabde38dce1faa0de022d3226f96f818e29e78eaeb11732814dc9888d38c8","observation_id":"4741bb01-186a-4ec0-bd45-1a6963879218","resolution":{"observed_at":"2026-08-06T00:08:30.045957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:29.652040Z","title":"Drivelm: Driving with graph visual question an- swering,","venue":null,"work_id":"3098c62c-21bd-458b-9e41-ee8bad0b73d8","year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.834498Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:11776a3a15824ee9a599abbf46d991b7280254a3705aa1da7669fff35b6b6636","observation_id":"e208d27b-6c49-489a-a96f-a16e44f19540","resolution":{"observed_at":"2026-08-06T00:08:29.766818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-06T00:08:20.946744Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:20.946744Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:e0b08d52511d03e1a033e4982164451a23a72abda57592becd4e066b4f02735a","observation_id":"8a9d686b-39f4-4f24-b02f-f61ff269d6b1","resolution":{"observed_at":"2026-08-06T00:08:20.946744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:21.077410Z","title":"Drivemlm: Aligning multi-modal large lan- guage models with behavioral planning states for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.077410Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:c63b5ae4089d9ddab244c31907e5e7a4a260b72e24bee430706b1bbcb5c0543c","observation_id":"f018b4b7-756e-4daa-9fda-7de07bb4afc3","resolution":{"observed_at":"2026-08-06T00:08:21.077410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13112","last_updated":"2025-05-27T14:49:49Z","snapshot_observed_at":"2026-08-18T00:12:48.617348Z","submitted_at":"2024-11-20T08:14:01Z","title":"SURDS: Benchmarking Spatial Understanding and Reasoning in Driving Scenarios with Vision Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13112","snapshot_observed_at":"2026-08-06T00:08:21.164171Z","title":"Drivemllm: A benchmark for spatial under- standing with multimodal large language models in autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.164171Z"},"links":{"cited_paper":"/paper/2411.13112","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:c029c22da0117f8a115634fdfda44f3765ff1933634577571d137d6712837c00","observation_id":"a667e433-03bf-4d1e-b049-b539811a5124","resolution":{"observed_at":"2026-08-06T00:08:21.164171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-17T03:32:41.611109Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.17685","snapshot_observed_at":"2026-08-06T00:08:21.257401Z","title":"Futuresightdrive: Thinking visually with spatio-temporal cot for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.257401Z"},"links":{"cited_paper":"/paper/2505.17685","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:79c342c1a4a90aa7c0ec871a7083419307ce65f98d3ab656a6a8cdc4b3be6248","observation_id":"06cbf30d-be95-47ba-9907-df70a268932c","resolution":{"observed_at":"2026-08-06T00:08:21.257401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.06218","last_updated":"2025-06-06T16:25:22Z","snapshot_observed_at":"2026-08-16T12:57:45.626855Z","submitted_at":"2025-06-06T16:25:22Z","title":"STSBench: A Spatio-temporal Scenario Benchmark for Multi-modal Large Language Models in Autonomous Driving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.06218","snapshot_observed_at":"2026-08-06T00:08:21.388777Z","title":"Stsbench: A spatio-temporal scenario benchmark for multi-modal large language models in autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.388777Z"},"links":{"cited_paper":"/paper/2506.06218","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:72444b3cd1da939c579242234f0b797b095d8ee7af6fb03d442145b93b4bf2ad","observation_id":"9b79c5e9-0f91-48c2-a21f-3c066ff5d836","resolution":{"observed_at":"2026-08-06T00:08:21.388777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.05277","last_updated":"2026-06-02T23:07:19Z","snapshot_observed_at":"2026-08-13T02:05:37.686752Z","submitted_at":"2025-12-04T21:57:10Z","title":"From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models","version":4},"cited_work":{"arxiv_id":"2512.05277","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.05277","snapshot_observed_at":"2026-08-06T00:08:25.881681Z","title":"From Segments to Scenes: Temporal Understanding for Agentic Autonomous Driving via Vision-Language Models","venue":"cs.CV","work_id":"db5b3921-290b-46d8-8359-6ad7acd2b50d","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.458381Z"},"links":{"cited_paper":"/paper/2512.05277","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:e32ee250a68b546d59982a50a8a449fb26a1676c16472ed4c2b742af6c84eb1f","observation_id":"9956e748-4d61-4a2f-b9b9-34bd44f4641d","resolution":{"observed_at":"2026-08-06T00:08:25.958869Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:29.427066Z","title":"Are vlms ready for autonomous driving? an em- pirical study from the reliability, data, and metric perspectives,","venue":null,"work_id":"10a75ee8-bcf2-4cf5-b215-a84cf2a78789","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.539113Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:42543f40b1112e522d5bc1d179fc0cfa5257b6b1facb7f6348f72a8d355d3a94","observation_id":"ac363621-c3fa-42cc-b8df-378206623e90","resolution":{"observed_at":"2026-08-06T00:08:29.539220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:29.194931Z","title":"Centerfusion: Center-based radar and camera fusion for 3d object detection,","venue":null,"work_id":"2935ac38-8efe-4000-8fee-239593c4fc83","year":2021},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.617105Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:4704a891634667f5766f81d10610f0397bf312266e7562d7530f0b90188c1fb5","observation_id":"5ed99b6b-8a07-4538-80e3-b57a1d92807b","resolution":{"observed_at":"2026-08-06T00:08:29.297006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:28.930324Z","title":"Rcbevdet: Radar-camera fusion in bird’s eye view for 3d object detection,","venue":null,"work_id":"027cc328-0bc8-497e-8e9a-06c509f2d4ff","year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.747711Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:2fb056ab0356dae517159fc69ae7940b9668ce2972c0716cc5bc5aa311c4aac9","observation_id":"dff2bb0a-6ad1-47be-9643-e49848d43eb9","resolution":{"observed_at":"2026-08-06T00:08:29.062149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:28.710248Z","title":"Crkd: Enhanced camera- radar object detection with cross-modality knowledge distilla- tion,","venue":null,"work_id":"2dbc5a6d-484c-4aad-94d7-c167ea4e4bb2","year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.851523Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:7e3da5c03184e0ffa644151522e0ff1cf5b34d011eb20831c744b1f727f6afe3","observation_id":"b93fb1eb-ca10-4c42-b5a0-7437558b6a3b","resolution":{"observed_at":"2026-08-06T00:08:28.815819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:28.390196Z","title":"Depth estimation from monocular images and sparse radar data,","venue":null,"work_id":"a3522bfd-d7dd-4235-8da3-37881ded6c70","year":2020},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:21.982890Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:50b510d757b51809f13a32472ced1d5ecc750c9b16fd05460e2970aa77e2fff7","observation_id":"7f859787-685e-4bc6-b1fd-c6748020be14","resolution":{"observed_at":"2026-08-06T00:08:28.536991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:28.188037Z","title":"Tacodepth: Towards efficient radar-camera depth estimation with one-stage fusion,","venue":null,"work_id":"f1f0297c-ac1a-4432-8dcf-6c1313788a68","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.106086Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:55f864dbb330e225d53333abd17e275166ae0d06e23f8e62d156faefbdac2fbe","observation_id":"93440d4e-9b79-456b-80bb-a3d2351a6bd6","resolution":{"observed_at":"2026-08-06T00:08:28.285714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:27.957767Z","title":"Depth estimation based on mmwave radar and camera fusion with attention mechanisms and multi-scale features for autonomous driving vehicles,","venue":null,"work_id":"7779b1fe-4a0a-42f4-a23c-562bd5ad532b","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.192535Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:5147b0776eb4f690641de0a9898b32cc97300b6d01b12dfdb85f2b2a1ad6cb47","observation_id":"474bbd75-b831-4724-8a56-5d59b40f19e2","resolution":{"observed_at":"2026-08-06T00:08:28.065025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:27.617996Z","title":"Full-velocity radar returns by radar-camera fusion,","venue":null,"work_id":"d0f35ba9-496b-4d7e-98a4-0599a47dfc6b","year":2021},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.301516Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:7ba40d2172645935cbd579330e199d0e9099ca428b064e03416da9685391b3d4","observation_id":"e98685ac-3743-405b-abff-e56ad04707a0","resolution":{"observed_at":"2026-08-06T00:08:27.808111Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:27.433098Z","title":"Pow4r: Point-wise full-velocity esti- mation using 4d radar-camera fusion beyond radial limitations,","venue":null,"work_id":"be64b5ed-203d-46b1-94a3-acbd35d4e232","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.379341Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:8869f92759a296095e26ae45ca5005fc71e80b6f696e5e1525bd77cecb018092","observation_id":"0863de55-442f-49a2-9172-d98f10a41ab6","resolution":{"observed_at":"2026-08-06T00:08:27.510749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18506","last_updated":"2025-08-25T21:26:32Z","snapshot_observed_at":"2026-08-18T11:08:10.126294Z","submitted_at":"2025-08-25T21:26:32Z","title":"DoGFlow: Self-Supervised LiDAR Scene Flow via Cross-Modal Doppler Guidance","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18506","snapshot_observed_at":"2026-08-06T00:08:22.454237Z","title":"Dogflow: Self-supervised lidar scene flow via cross-modal doppler guidance,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.454237Z"},"links":{"cited_paper":"/paper/2508.18506","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:2a93767e5d8648e408f0e3733686e90c9b1acb3561c0437608c790d9ce2d6ec8","observation_id":"8d05cd7b-582e-4515-b52d-c29d0dd4a1bb","resolution":{"observed_at":"2026-08-06T00:08:22.454237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.10376","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:25.644013Z","title":"Raliflow: Scene flow esti- mation with 4d radar and lidar point clouds,","venue":null,"work_id":"6e345456-fee8-42ea-b731-18f1bffc9fce","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.565733Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:6b3ffef785d62f9237a4f32961632cb79bb5c5be207f89a0d0131eb45f0f700e","observation_id":"0222c4fd-8ec4-4f12-80dd-f648f684a5e2","resolution":{"observed_at":"2026-08-06T00:08:25.760282Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.04814","last_updated":"2021-11-29T18:29:54Z","snapshot_observed_at":"2026-08-16T18:04:02.574512Z","submitted_at":"2021-08-10T17:57:03Z","title":"R4Dyn: Exploring Radar for Self-Supervised Monocular Depth Estimation of Dynamic Scenes","version":2},"cited_work":{"arxiv_id":"2108.04814","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.04814","snapshot_observed_at":"2026-08-06T00:08:25.141591Z","title":"R4Dyn: Exploring Radar for Self-Supervised Monocular Depth Estimation of Dynamic Scenes","venue":"cs.CV","work_id":"94f6ed8f-73e6-4173-b7ac-8242f80a7664","year":2021},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.647934Z"},"links":{"cited_paper":"/paper/2108.04814","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:4b4283b387ead9ed6cb67d0b2d6fde4caaea8b6521c0c89e6090dd1b6d4ee8ec","observation_id":"67fd4b07-3a56-4039-a0b3-c407516f0295","resolution":{"observed_at":"2026-08-06T00:08:25.365599Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:27.152857Z","title":"Radar as a teacher: Weakly supervised vehicle detection using radar labels,","venue":null,"work_id":"2314cc78-2ade-421a-a2be-6616d29bdca7","year":2020},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.747768Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:91eecc0a7827ac3349b7ad95e3b4a3ecdf21c62adb1cf41a350b664cb7d3483a","observation_id":"67be25d9-cdb1-40db-bb17-7c86d708f6da","resolution":{"observed_at":"2026-08-06T00:08:27.309381Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.13772","last_updated":"2023-09-24T22:59:05Z","snapshot_observed_at":"2026-08-16T14:58:02.057852Z","submitted_at":"2023-09-24T22:59:05Z","title":"Motion Segmentation from a Moving Monocular Camera","version":1},"cited_work":{"arxiv_id":"2309.13772","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.13772","snapshot_observed_at":"2026-08-06T00:08:24.839476Z","title":"Motion Segmentation from a Moving Monocular Camera","venue":"cs.CV","work_id":"f1ac2608-3861-4b9c-a497-6fbd92d19064","year":2023},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.803353Z"},"links":{"cited_paper":"/paper/2309.13772","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:ad78d5e47646d05d227cd67576af4f9b428873a4b7f18102b471ea5d22d06515","observation_id":"613ee83b-8dfc-47f2-9a4a-5924d399bccd","resolution":{"observed_at":"2026-08-06T00:08:24.971547Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19141","last_updated":"2024-11-28T13:42:35Z","snapshot_observed_at":"2026-08-15T08:21:14.529543Z","submitted_at":"2024-11-28T13:42:35Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","version":1},"cited_work":{"arxiv_id":"2411.19141","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.19141","snapshot_observed_at":"2026-08-06T00:08:24.618390Z","title":"On Moving Object Segmentation from Monocular Video with Transformers","venue":"cs.CV","work_id":"4feb1067-0ae5-43db-aca4-c7efc89605c5","year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:22.965713Z"},"links":{"cited_paper":"/paper/2411.19141","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:68818fbd6635485f9cb0d4dd9ffd33e24928de2aa13ed7ff5d012f46c0161f10","observation_id":"181391c7-e4c7-4f0e-8e3f-77e358b139b5","resolution":{"observed_at":"2026-08-06T00:08:24.740167Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22268","last_updated":"2025-04-14T05:34:33Z","snapshot_observed_at":"2026-08-19T20:36:19.017754Z","submitted_at":"2025-03-28T09:34:11Z","title":"Segment Any Motion in Videos","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22268","snapshot_observed_at":"2026-08-06T00:08:23.125069Z","title":"Segment any motion in videos,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.125069Z"},"links":{"cited_paper":"/paper/2503.22268","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:b71a0f45312bc6bef2ede73e2766addef3296a10d008d1a50f68069a0d2a65da","observation_id":"3da10449-a9ad-4ec6-ac8b-2d0236ce4151","resolution":{"observed_at":"2026-08-06T00:08:23.125069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1802.07094","last_updated":"2018-02-20T12:54:39Z","snapshot_observed_at":"2026-08-15T17:55:23.700566Z","submitted_at":"2018-02-20T12:54:39Z","title":"Camera-based vehicle velocity estimation from monocular video","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1802.07094","snapshot_observed_at":"2026-08-06T00:08:23.220951Z","title":"Camera-based vehicle velocity estimation from monocular video,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.220951Z"},"links":{"cited_paper":"/paper/1802.07094","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:f26c62c66625a7d43c73e9b90fbd626ce58e46084ed7d5d5a0e02c276fd604cc","observation_id":"de26c729-7025-45b3-be19-1ca62d31c9ce","resolution":{"observed_at":"2026-08-06T00:08:23.220951Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:26.894226Z","title":"Kinematic 3d object detection in monocular video,","venue":null,"work_id":"2f72909a-60ef-40af-8343-04d9eea7ffc0","year":2020},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.332082Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:5f8e67ad3efb129613bdbb35341e00ca2851406baff2a6560b49a62384dd4275","observation_id":"aea2e315-8466-492f-b061-b562bfd879a7","resolution":{"observed_at":"2026-08-06T00:08:27.010857Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:26.709555Z","title":"Self-supervised monocular scene flow estimation,","venue":null,"work_id":"a0ad693f-5225-41cf-ac49-899dafaf69ca","year":2020},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.437414Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:47dd9dcdc5ac2cafff25d2d19cad0120a9f49ae6836d229b2cd4fa0c201fdf47","observation_id":"cccd1ebe-d35b-4625-9b9b-c100e971de50","resolution":{"observed_at":"2026-08-06T00:08:26.786164Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:23.557830Z","title":"Any4d: Unified feed-forward metric 4d reconstruction,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.557830Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:3bcf201d347a31de9a849f8da3cd06ae663822d1649f4a6451751adb1a9672db","observation_id":"b4900de5-bfd1-4624-8d83-f8a5e16b096d","resolution":{"observed_at":"2026-08-06T00:08:23.557830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:26.511623Z","title":"Zero-shot monocular scene flow estimation in the wild,","venue":null,"work_id":"76937c95-7865-489a-ac35-2a5cc07bb5f3","year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.667264Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:aca419880a87346b8fec7506387a3d8b20bab956de450068bd1a1ceace420ba7","observation_id":"aa546dae-ed51-4f04-a201-c0a60ec2eb4e","resolution":{"observed_at":"2026-08-06T00:08:26.635017Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:08:26.289169Z","title":"nuscenes: A multimodal dataset for au- tonomous driving,","venue":null,"work_id":"4f8553d8-c51d-414c-9eca-65fc315ebf1f","year":2020},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.822032Z"},"links":{"citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:4856970127a1b8b1245135bce8c0321a6823af30868b3582000fce5ec6959405","observation_id":"0bbd0220-af8b-4509-92c5-edfcf3aed0ef","resolution":{"observed_at":"2026-08-06T00:08:26.393482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-06T00:08:23.895579Z","title":"Qwen3-vl technical report,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:23.895579Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:1e6119cea6e829874398f630113a4e5db3a1fc760cab62c97fdd4007121efcc6","observation_id":"f8d41ceb-5dcf-4678-88b0-9b2db312db56","resolution":{"observed_at":"2026-08-06T00:08:23.895579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T00:08:24.093133Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:24.093133Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:358ef7467f73fd0f29ffe6aebba5cca2bd283f340b39363127b319f49a20da93","observation_id":"0d0bfa25-211d-447c-b102-35dc81f4dbd5","resolution":{"observed_at":"2026-08-06T00:08:24.093133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15558","last_updated":"2025-05-19T17:59:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-18T22:06:58Z","title":"Cosmos-Reason1: From Physical Common Sense To Embodied Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15558","snapshot_observed_at":"2026-08-06T00:08:24.264448Z","title":"Cosmos-reason1: From physical common sense to embodied reasoning,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:08:24.264448Z"},"links":{"cited_paper":"/paper/2503.15558","citing_paper":"/paper/2608.01535"},"observation_digest":"sha256:e113a6689fd78330a88019f5cd4bc83acfa0224a39dc44834b76b646856fe95e","observation_id":"368334ce-a943-4ed4-94bd-76312588ab64","resolution":{"observed_at":"2026-08-06T00:08:24.264448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01535","last_updated":"2026-08-02T23:02:06Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T00:48:19.316954Z","submitted_at":"2026-08-02T23:02:06Z","title":"STAR-VLM: Spatiotemporal Grounding Vision-Language Models for Motion and Velocity Estimation via Automotive Radar Supervision"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":5,"verified_fuzzy":20},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.01535."}