{"as_of":"2026-08-15T13:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bec6aade7009c024c3a831759f6814324f468dd0e9cda323d34c75107208826d","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T17:04:12.534638Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.12980/citation-record","integrity":"/paper/2411.12980/integrity","json":"/paper/2411.12980/citation-record.json","paper":"/paper/2411.12980"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.995993Z","title":"Meteor: An auto- matic metric for mt evaluation with improved correla- tion with human judgments","venue":null,"work_id":"1dbe811e-59e5-457d-8995-0aa2b952846e","year":2005},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.403437Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:04a849d159390adfd6416f125e2d35506f599d298f66b31eee52c7e2782dcc62","observation_id":"86041218-8aff-4b6b-84bc-689843ff16d2","resolution":{"observed_at":"2026-08-12T17:04:13.000461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.981962Z","title":"Is space-time attention all you need for video under- standing? In Proceedings of the International Confer- ence on Machine Learning (ICML) , 2021","venue":null,"work_id":"4b118cce-83b4-46fd-af81-8ec020374bbb","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.408133Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:6ad91c37d7f1b23e4e07c229bde92e20282d416f30cd27ca32445ff78c422e69","observation_id":"f011736c-f8a9-4ef8-a26c-fe26925ceb21","resolution":{"observed_at":"2026-08-12T17:04:12.986694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.968253Z","title":"Driving with llms: Fusing object-level vector modality for explainable au- tonomous driving","venue":null,"work_id":"06af6c96-fbfe-4713-8e68-76f5da111afe","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.413197Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:e087f49f6847e83df2857e5fd62d623d9b1198d516678d827b3a5ac4ec48e98b","observation_id":"f84fc7a9-acd8-41d7-8f0b-201a3dc32b79","resolution":{"observed_at":"2026-08-12T17:04:12.972759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.954415Z","title":null,"venue":null,"work_id":"a975f031-fb86-4455-9d4f-78c4727371b8","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.418422Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:cf0e2d99ca56516d0932c02468415c65616017708296c79468138d12b7c4e9fa","observation_id":"6aafe554-1c1a-4b4f-abac-76eda3a1acb6","resolution":{"observed_at":"2026-08-12T17:04:12.959236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.939698Z","title":null,"venue":null,"work_id":"3ec12a4a-7710-4245-9d63-f8f7d5213ac0","year":2022},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.423188Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:720442db214f36de0a425093582fdd060b2a5d8f914f54b47a0890eb934f071f","observation_id":"d8aea3a9-ae68-4007-bee3-80b756e9160e","resolution":{"observed_at":"2026-08-12T17:04:12.943907Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.925579Z","title":"Multi-frame, lightweight & efficient vision- language models for question answering in autonomous driving, 2024","venue":null,"work_id":"d6aa1d88-f969-4f56-8621-4f8c189fdbc1","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.427829Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:9c5d785c890ba43ae142d110c85a6b028e52e7e66e878808aaaf2f84fd9f59d4","observation_id":"538aa569-23ce-4222-b5e1-06dda7eca6ca","resolution":{"observed_at":"2026-08-12T17:04:12.929941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.912290Z","title":"Lan- guage is not all you need: Aligning perception with language models","venue":null,"work_id":"7dc12393-e456-4c48-837a-b2912ecc8d1d","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.433051Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:2eac97a871b7d4897150650e8e52123e1429f6915130754d031eabe290589cf1","observation_id":"a4625a06-954b-4d22-b348-91195ef325f5","resolution":{"observed_at":"2026-08-12T17:04:12.916476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.899256Z","title":null,"venue":null,"work_id":"a146348a-78dc-4866-81f5-71613770998a","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.437309Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:0ed80936a286df23e1dbde6636d51774d63ae6a3b033d18b87dc328a70c0ea34","observation_id":"ba3795a1-fcc4-443f-8bc1-29b4958c04c7","resolution":{"observed_at":"2026-08-12T17:04:12.903365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.885828Z","title":"Vlm2scene: Self-supervised image-text-lidar learning with foundation models for autonomous driving scene understanding","venue":null,"work_id":"463f33e8-2de0-4d0d-97aa-291b51664e1e","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.441331Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:cd037a2e0c48e4fc445f71768de99fdc166f26bc7c0568f4ca3ebbabbd6d2e06","observation_id":"6d7d7217-284e-4943-b22a-6c26ee1f3184","resolution":{"observed_at":"2026-08-12T17:04:12.890378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.872482Z","title":"Rouge: A package for automatic eval- uation of summaries","venue":null,"work_id":"335e53d0-2c46-4a11-be79-ffdd2c939317","year":2004},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.446091Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:96b9eb5baab9f7619da136007959e211d48d786841ff2955fe1cab8f39fecc75","observation_id":"bad55b0c-c5c0-42a3-aaf7-2de3c733c1a4","resolution":{"observed_at":"2026-08-12T17:04:12.876859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.857928Z","title":"Reason2drive: Towards interpretable and chain-based reasoning for autonomous driving","venue":null,"work_id":"04ca0a13-80e1-4696-b39c-5a296743819d","year":2025},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.450285Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:2b929e7721d80e8144d87a09c64bbc904c2bf665200036d9f81d0587eb0a5070","observation_id":"b553a8a7-9463-4a09-90ec-85fa53af4f8d","resolution":{"observed_at":"2026-08-12T17:04:12.862162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.845097Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":"b66fb8d1-e560-4976-8b70-7745fc5ead96","year":2002},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.454302Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:e55103817a30ff2deabb4a1967ff40e048cd83586b4b4f0046277f64a276f1a5","observation_id":"c1ef6a27-0967-4f2a-9925-6cf2dd410e98","resolution":{"observed_at":"2026-08-12T17:04:12.849459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.830757Z","title":"Nuscenes-qa: A multi-modal vi- sual question answering benchmark for autonomous driving scenario","venue":null,"work_id":"34f686ff-6f90-4f0e-9c84-ec96f193a80b","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.458461Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:1ba88e29d75d803e6d235f8d1d80dcd45c31c984d06e49227f80cf1343b4eb70","observation_id":"ecb3508d-e648-4b9c-8038-f9a54b2c54bc","resolution":{"observed_at":"2026-08-12T17:04:12.835795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.815903Z","title":"Nuscenes-qa: A multi-modal vi- sual question answering benchmark for autonomous driving scenario, 2024","venue":null,"work_id":"b17e8af1-90f6-49bf-b494-2fd963d3a995","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.462299Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:69462d10e324e880035e1750590a7942ba52aff43171fa482360aaa58993c2ae","observation_id":"f224662a-2fc6-4579-8a4b-aafadeff4360","resolution":{"observed_at":"2026-08-12T17:04:12.820295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.801740Z","title":"Learning trans- ferable visual models from natural language supervi- sion","venue":null,"work_id":"cfa700cc-9cb4-471f-bdc7-360a06697a39","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.466285Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:c7244550ad6f5ca85cf55eecea9e173372fe915f56efd69afa63c8735ec949c3","observation_id":"61fe9706-91d6-4d97-b1d3-bd4be4186a4e","resolution":{"observed_at":"2026-08-12T17:04:12.806538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.788423Z","title":"Learning transferable visual models from natural lan- guage supervision","venue":null,"work_id":"f08dccc9-f458-408b-a8d1-c643b45e0a8d","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.470510Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:a167b42516c1da0c6aabb987b65ef40d1375053bc003c3f576dd753e98e79af8","observation_id":"6c8d36c6-10d2-4da4-a0f2-dc81b6105dc9","resolution":{"observed_at":"2026-08-12T17:04:12.792941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.773967Z","title":null,"venue":null,"work_id":"a43e7518-cc0d-4b02-a1d4-a0631c1893f8","year":null},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.474717Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:830fb7896a8a42c4a90332f982cad188fb2cc6a940742e6cae6db362cae765eb","observation_id":"01bb169f-3f79-4e84-95bf-473735016ed3","resolution":{"observed_at":"2026-08-12T17:04:12.778559Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03026","last_updated":"2025-04-15T03:45:30Z","snapshot_observed_at":"2026-08-13T22:49:57.954752Z","submitted_at":"2023-10-04T17:59:49Z","title":"LanguageMPC: Large Language Models as Decision Makers for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03026","snapshot_observed_at":"2026-08-12T17:04:12.479080Z","title":"Languagempc: Large language models as decision makers for autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.479080Z"},"links":{"cited_paper":"/paper/2310.03026","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:fe1803caf988658f76d1552b31947b7ebfa7f6f83a80d14475271712c83f42ca","observation_id":"2dfbf586-d531-4699-bb65-c4f8b611ec18","resolution":{"observed_at":"2026-08-12T17:04:12.479080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14150","last_updated":"2025-01-16T10:57:44Z","snapshot_observed_at":"2026-08-13T04:55:49.773157Z","submitted_at":"2023-12-21T18:59:12Z","title":"DriveLM: Driving with Graph Visual Question Answering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14150","snapshot_observed_at":"2026-08-12T17:04:12.484511Z","title":"Drivelm: Driving with graph visual question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.484511Z"},"links":{"cited_paper":"/paper/2312.14150","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:0a46f62a1523cc3851b41a14df0bec2db4c7ad35dc06c47ea395abc8d756707a","observation_id":"84653957-d64b-4755-a4ba-b2c4cc630430","resolution":{"observed_at":"2026-08-12T17:04:12.484511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12289","last_updated":"2024-06-25T17:55:35Z","snapshot_observed_at":"2026-08-13T08:07:31.942031Z","submitted_at":"2024-02-19T17:04:04Z","title":"DriveVLM: The Convergence of Autonomous Driving and Large Vision-Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12289","snapshot_observed_at":"2026-08-12T17:04:12.489019Z","title":"Drivevlm: The convergence of autonomous driving and large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.489019Z"},"links":{"cited_paper":"/paper/2402.12289","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:975f9f971b6bd3755317dbbebf89c0ad84bc02481d48c9a1b0f77e9051608438","observation_id":"5b51f4e3-4620-47fb-8dae-1566368f4a0c","resolution":{"observed_at":"2026-08-12T17:04:12.489019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.760837Z","title":"Cider: Consensus-based image descrip- tion evaluation","venue":null,"work_id":"b4427007-1bbf-4afd-87d4-2c29c92d6b23","year":2015},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.493514Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:45cf6bb66afedb40dec1904995c892088f44e1cc1761a76cd05ee5e2b89918fa","observation_id":"35c8512b-0fc0-4eab-bb37-bd93adca5750","resolution":{"observed_at":"2026-08-12T17:04:12.765032Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.746884Z","title":"Driving into the future: Multiview visual forecasting and planning with world model for autonomous driving","venue":null,"work_id":"a1835e24-86cb-48cf-826c-9bf4d2e97ead","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.497165Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:f486f4c60641432e8913c2283adfa8378017c38f2aa0af9a96d70ae4f75ba258","observation_id":"f69c3665-b71d-42e9-a2c5-7c6f890bdb49","resolution":{"observed_at":"2026-08-12T17:04:12.751668Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.733433Z","title":null,"venue":null,"work_id":"e2351c82-0858-4ed6-8296-d81b5d5e9fca","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.500769Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:d09f330638b3aea45114ba684b2a6d2abdca0cd0ad728405a60cb8dd0e92f8ce","observation_id":"15cdc746-7f21-4404-b411-0f9b966323bc","resolution":{"observed_at":"2026-08-12T17:04:12.738054Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05332","last_updated":"2023-11-28T09:47:57Z","snapshot_observed_at":"2026-08-13T07:20:13.996757Z","submitted_at":"2023-11-09T12:58:37Z","title":"On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05332","snapshot_observed_at":"2026-08-12T17:04:12.504683Z","title":"On the road with gpt-4v (ision): Early explorations of visual-language model on autonomous driving","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.504683Z"},"links":{"cited_paper":"/paper/2311.05332","citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:094450a23cc2d634cf98f8a88548e2248215aa7fdd4e7994165787acf447c6d4","observation_id":"c36ce008-a22d-42ed-92d7-eeac749c2f44","resolution":{"observed_at":"2026-08-12T17:04:12.504683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.719948Z","title":"Drivegpt4: Interpretable end-to-end au- tonomous driving via large language model","venue":null,"work_id":"e711a769-34c6-4b25-acef-c705efdfba4e","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.508759Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:71468472ce8b41d13b8b68d2a3e77e516b3d06fda522660c55d89451da6e55d5","observation_id":"886f1fca-9726-41e7-ba3f-309ae6077c0f","resolution":{"observed_at":"2026-08-12T17:04:12.724266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.703327Z","title":"Generalized predictive model for autonomous driving","venue":null,"work_id":"49fd20ee-7088-45dd-8e9b-84ebeb64ff3f","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.512334Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:f3f172a80e67b1c2cf22e6b29d28378a01e53ab91f4fa449084b748232b162ca","observation_id":"ec8d9c15-47d0-4e7d-a638-83c0f32f72fd","resolution":{"observed_at":"2026-08-12T17:04:12.708896Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.686390Z","title":null,"venue":null,"work_id":"c044a57d-d490-430b-be01-ec195977d8bf","year":2022},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.516332Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:56dfa9cc26786068a8bde5bd67784be8788640530108bcd30ed019f600bcc2f0","observation_id":"c18a6a17-0799-481b-a108-076ff5cd00e6","resolution":{"observed_at":"2026-08-12T17:04:12.691591Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.670281Z","title":null,"venue":null,"work_id":"072410e8-bb6f-415b-8c5f-8c60c5e72f48","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.521039Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:5610d2103e1dc212deda42b4f0a0419e3e9a3e94d7be06bf21599d642d7e9611","observation_id":"89310149-e210-4e64-9f4a-f30d081609b5","resolution":{"observed_at":"2026-08-12T17:04:12.675307Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.654872Z","title":"Zhang, L","venue":null,"work_id":"007ca5c5-8e0d-42f1-9950-42aabb23f985","year":2024},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.526011Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:70288bbb428ac8f34d09496d4f1af960753b3d50045fe7e0ac24a2744573f2d1","observation_id":"0f57dc8e-2d87-49ac-805a-5f9b85c6f755","resolution":{"observed_at":"2026-08-12T17:04:12.659776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.638172Z","title":"Vinvl: Revisiting visual representa- tions in vision-language models","venue":null,"work_id":"b502e809-ac29-49f7-b30b-2de52a689e3f","year":2021},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.530750Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:35bfcfc2704718f09c36d5a8a9456e71f7ec513c735ea996ec2e8daa37fe8891","observation_id":"6517acc2-d355-421e-87a7-9ab5d979b4c1","resolution":{"observed_at":"2026-08-12T17:04:12.643933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T17:04:12.620724Z","title":null,"venue":null,"work_id":"9bf66c9f-ff24-4361-a33a-bae75fd0dd23","year":2023},"citing_paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T17:04:12.534638Z"},"links":{"citing_paper":"/paper/2411.12980"},"observation_digest":"sha256:eb555c102c11ade183ea90e55b111e983a23da6959928894b4327124f0fc230b","observation_id":"3794ec17-d05f-4a00-9956-3b7668594d7e","resolution":{"observed_at":"2026-08-12T17:04:12.626385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.12980","last_updated":"2025-02-22T16:03:34Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T11:35:52.363245Z","submitted_at":"2024-11-20T02:14:07Z","title":"LaVida Drive: Vision-Text Interaction VLM for Autonomous Driving with Token Selection, Recovery and Enhancement"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":19},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2411.12980."}