{"as_of":"2026-08-09T02:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b471bc8488b3213861f5c9fd23ee69fbe73dddc92dd99de8a140bde65671a1b","coverage":[{"denominator":144,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T20:52:06.559453Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.08302/citation-record","integrity":"/paper/2509.08302/integrity","json":"/paper/2509.08302/citation-record.json","paper":"/paper/2509.08302"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.955693Z","title":"3d object detection for autonomous driving: A survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.955693Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:05e0bcd0dc57373aa433d94ec73cc32db48583a986ae76dc250b8e56aebf298a","observation_id":"f9257e52-cd33-479b-abe0-31b69599653d","resolution":{"observed_at":"2026-08-04T20:52:05.955693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.961813Z","title":"Vision-based semantic segmentation in scene understanding for autonomous driving: Recent achievements, challenges, and out- looks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.961813Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b6ea0cbfd8840cab2aae391bf73774ff513f526631fe3a5591233047062cce7e","observation_id":"c764dff8-139f-46ed-bdb8-23c5de0b39fb","resolution":{"observed_at":"2026-08-04T20:52:05.961813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.966653Z","title":"A review of deep learning-based visual multi-object tracking algorithms for autonomous driving,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.966653Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f0daa8caf1d417c461fe1a80eff7cedb736eb96709127a08445c41d4c64731ab","observation_id":"5f403c37-4c36-41ed-8fb0-76bce0f8ac70","resolution":{"observed_at":"2026-08-04T20:52:05.966653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:05.972339Z","title":"Towards long-tailed 3d detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.972339Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:bec68dd11e5620802e80a4c78d1736c4c7d35731e093d18fe3f8eab4807da379","observation_id":"d65b8950-a850-4da0-acd1-0ccb76d5e3ae","resolution":{"observed_at":"2026-08-04T20:52:05.972339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-04T20:52:05.979955Z","title":"On the opportuni- ties and risks of foundation models,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.979955Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e6fa78725f26ffcd626e113abd60cc562c1982104d341f381d97d1ee71be980e","observation_id":"e465f32f-7cec-4df0-ad99-fe71a4c90dd1","resolution":{"observed_at":"2026-08-04T20:52:05.979955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08045","last_updated":"2024-01-16T01:57:24Z","snapshot_observed_at":"2026-08-03T22:56:13.995956Z","submitted_at":"2024-01-16T01:57:24Z","title":"Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08045","snapshot_observed_at":"2026-08-04T20:52:05.987906Z","title":"Forging vision foundation models for autonomous driving: Challenges, methodologies, and opportunities,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.987906Z"},"links":{"cited_paper":"/paper/2401.08045","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ff59ed647fbaf2e9f375e90e94db423b8e648472731d7e6ec5007bf5d83bea89","observation_id":"fae8c30c-c100-4f15-9b78-df95426c161b","resolution":{"observed_at":"2026-08-04T20:52:05.987906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12144","last_updated":"2024-01-05T01:58:58Z","snapshot_observed_at":"2026-08-02T14:54:39.196220Z","submitted_at":"2023-11-20T19:45:27Z","title":"Applications of Large Scale Foundation Models for Autonomous Driving","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12144","snapshot_observed_at":"2026-08-04T20:52:05.993544Z","title":"Applications of large scale foundation models for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.993544Z"},"links":{"cited_paper":"/paper/2311.12144","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:bc4f6f4b6468ab403cd1242d04b00b5a28802ba9b0f4218b8b9a0a95ae4318fa","observation_id":"376c9556-8aff-430c-8e30-75316db34504","resolution":{"observed_at":"2026-08-04T20:52:05.993544Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01105","last_updated":"2024-09-05T03:38:08Z","snapshot_observed_at":"2026-07-06T17:24:03.237617Z","submitted_at":"2024-02-02T02:44:59Z","title":"A Survey for Foundation Models in Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01105","snapshot_observed_at":"2026-08-04T20:52:05.999643Z","title":"A survey for foundation models in au- tonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:05.999643Z"},"links":{"cited_paper":"/paper/2402.01105","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:1e172697f5fb706b92e56786ae36668802672cfecd632c4d1f169ae3fb4ac28e","observation_id":"d0e341af-95d9-4c15-8f84-6db07cbdc06b","resolution":{"observed_at":"2026-08-04T20:52:05.999643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.006340Z","title":"Prospective role of foundation models in advancing autonomous vehicles,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.006340Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:80d7e402d17508b9dcb2ca425a011f7cb47211526a4734912e2918d0457e70e4","observation_id":"1888f426-0ae8-4a6a-a30a-965628e0aa72","resolution":{"observed_at":"2026-08-04T20:52:06.006340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.01043","last_updated":"2024-08-12T11:53:28Z","snapshot_observed_at":"2026-07-06T16:42:04.139453Z","submitted_at":"2023-11-02T07:23:33Z","title":"LLM4Drive: A Survey of Large Language Models for Autonomous Driving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.01043","snapshot_observed_at":"2026-08-04T20:52:06.018250Z","title":"Llm4drive: A survey of large language models for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.018250Z"},"links":{"cited_paper":"/paper/2311.01043","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d9d18b01438f38242493d96565df8757234cf2455f5e3b2ad2c68c960491724a","observation_id":"044ac690-0940-4526-a418-a6c219682e59","resolution":{"observed_at":"2026-08-04T20:52:06.018250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.023527Z","title":"Vision language models in autonomous driving: A survey and outlook,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.023527Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:11da0d155724d0524b92f7609967be10f7f35d698b4e55d38e432a83b359d26b","observation_id":"d9f5dca6-921b-453c-bc8c-5a1e01fa2b39","resolution":{"observed_at":"2026-08-04T20:52:06.023527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.032288Z","title":"A simple framework for contrastive learning of vi- sual representations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.032288Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:521b7078adfd00cad9ac16442d7f08be9c333d6798aeede01bf69acfa2c2064e","observation_id":"de83e643-f1ad-4c54-9db8-23edaf01ae9f","resolution":{"observed_at":"2026-08-04T20:52:06.032288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.037588Z","title":"Momentum contrast for unsupervised visual repre- sentation learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.037588Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ad0d12496777d5885e36a4ecbac1903852b0e3330100ca30d7cd51568ce08970","observation_id":"5bad0149-16d2-4d99-a209-330436757d0d","resolution":{"observed_at":"2026-08-04T20:52:06.037588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-04T20:52:06.043634Z","title":"Improved baselines with momentum contrastive learning,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.043634Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f09556033d0ec6dcda21af6042712162d6cdfa225f76844470e61c0d092d134d","observation_id":"a1f52ee6-a4a5-4f23-a82e-2645a82f60fb","resolution":{"observed_at":"2026-08-04T20:52:06.043634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.049114Z","title":"Masked autoencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.049114Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e41abbb05936429ef7f5c2be11af0f11abcaea1421918609e2f13dcbbd241f71","observation_id":"2925c295-deca-4236-ad6e-2b8327b9cd3c","resolution":{"observed_at":"2026-08-04T20:52:06.049114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-04T20:52:06.054078Z","title":"An image is worth 16x16 words: Transformers for image recogni- tion at scale,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.054078Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e2ad10016a55df1ff8f157f86fe2432e1ae5034b3eb24d300a58d2c2d98920f2","observation_id":"d69169fb-6421-4219-bfed-0898ef033262","resolution":{"observed_at":"2026-08-04T20:52:06.054078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-04T20:52:06.060395Z","title":"Distilling the knowledge in a neural network,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.060395Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7daacd28aeade2715531835cfe2f0cd18fd22ad5ac025d81b4081b245c42c8dd","observation_id":"b399a9ea-240a-4d5c-a12f-56223cef3f85","resolution":{"observed_at":"2026-08-04T20:52:06.060395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.070561Z","title":"Knowledge distillation: A survey,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.070561Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c99e12d3eedc58f953e58dc4b02e7b6fc8b5728aa8522655c71deca8d462d9ad","observation_id":"7a598d00-ea11-4715-a1d1-607a76e0c35d","resolution":{"observed_at":"2026-08-04T20:52:06.070561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.078479Z","title":"Self- training with noisy student improves imagenet classi- fication,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.078479Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:6b3a5c1fdb645b03dc3eab5c8d4aa4069da4c8b5b8423d37b1a6afbfc535dd7f","observation_id":"75a8cb68-f62b-4daa-a0b1-342804835a49","resolution":{"observed_at":"2026-08-04T20:52:06.078479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.087477Z","title":"Bootstrap your own latent-a new approach to self- supervised learning,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.087477Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:bdcf03c84f69bb9870a9825b2d78ed3ddcc683beafbb457436076c888c4c9b31","observation_id":"4ba07694-93b0-44ed-9bf7-c19fb1310825","resolution":{"observed_at":"2026-08-04T20:52:06.087477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.093522Z","title":"Emerging properties in self-supervised vision transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.093522Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:30f32eca66ce6b744fc986c5df7acd99f1982f12a478144f04ef6adc573105b6","observation_id":"29de20c4-8203-44df-8485-5d5e16fd24b2","resolution":{"observed_at":"2026-08-04T20:52:06.093522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.098456Z","title":"Structure-from- motion revisited,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.098456Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f32e2e3c5780dd82d1c064618e7b6eba8392a698900549d0596dcd829bf6a0b5","observation_id":"997aae34-57c4-4592-92e7-b5ab8cd71ea4","resolution":{"observed_at":"2026-08-04T20:52:06.098456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.103056Z","title":"Multi-view stereo: A tutorial,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.103056Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:def745f73219997d524f2179785ed2d3320709656f9e05ef34569b54af155ae7","observation_id":"d9c70e9f-8a34-4c5f-b79f-5ae34ecf8564","resolution":{"observed_at":"2026-08-04T20:52:06.103056Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.108496Z","title":"Past, present, and future of simultaneous localization and mapping: Toward the robust-perception age,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.108496Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d8c5acd52f7eb42185a5da43c3b90e5e309911b478e470bd1337f8f23151e4c8","observation_id":"4546bf8d-89ba-441f-a2e0-d6ccdc165bf5","resolution":{"observed_at":"2026-08-04T20:52:06.108496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.114614Z","title":"3d-r2n2: A unified approach for single and multi- view 3d object reconstruction,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.114614Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:244dd11ea4d07b9dbfd44e156250c749a7398af8966994f9c0b5169ff1a97ff8","observation_id":"96ab3df6-150f-4ccf-a4c3-f3435abbd036","resolution":{"observed_at":"2026-08-04T20:52:06.114614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.121630Z","title":"Predicting depth, surface normals and semantic labels with a common multi- scale convolutional architecture,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.121630Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4875982cc73c7c0d7b22a7a81c1116b2d716df3b8a0a4a22acc8c71a019b814b","observation_id":"0e257a96-f1ae-48f4-8d41-bbbc38e21073","resolution":{"observed_at":"2026-08-04T20:52:06.121630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.126104Z","title":"Nerf: Representing scenes as neural radiance fields for view synthesis,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.126104Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d9b62e3be69017723be8b6402fe626ce44fa5cae1717e3811caa2bb15600358c","observation_id":"bbb8a972-b932-4b27-96bd-8e63b568c99d","resolution":{"observed_at":"2026-08-04T20:52:06.126104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.131796Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.131796Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0aa9cb4b8345af91affe0b66f4190a188aca3c60a7b0e1d2a42d14a229548086","observation_id":"1dfc9792-243d-4bc1-8da5-8ebb0307a6e2","resolution":{"observed_at":"2026-08-04T20:52:06.131796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.02767","last_updated":"2018-04-08T22:27:57Z","snapshot_observed_at":"2026-08-06T11:09:16.409556Z","submitted_at":"2018-04-08T22:27:57Z","title":"YOLOv3: An Incremental Improvement","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.02767","snapshot_observed_at":"2026-08-04T20:52:06.136278Z","title":"Yolov3: An incremen- tal improvement,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.136278Z"},"links":{"cited_paper":"/paper/1804.02767","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e27db83bb9d90e24d9e69f96f8dd8f76a45bd94109077bc08364bb1ef1a678fd","observation_id":"7465bef0-9337-46c8-912c-65294b4f72fb","resolution":{"observed_at":"2026-08-04T20:52:06.136278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.141344Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.141344Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7d5cd0849acea9db0c48460ee6c51bb0675a3dd9a71d0fd18f6221a768da2639","observation_id":"8d63dc12-8850-4364-8ce0-a4ae4ccea62f","resolution":{"observed_at":"2026-08-04T20:52:06.141344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-04T20:52:06.146791Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.146791Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:71b326cecb3013c59a06778dee5cca81722f3db5bde524aed34a19622eadbe88","observation_id":"6bbaf5a6-75be-4b30-b814-8e055348648e","resolution":{"observed_at":"2026-08-04T20:52:06.146791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.151255Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.151255Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d5248027153f2d0ec77221da0aa6ebfefd7e58c12997f4bd890a63d28afd0ec1","observation_id":"306ef2ef-2bec-429d-880a-6fdb354c8660","resolution":{"observed_at":"2026-08-04T20:52:06.151255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.156549Z","title":"Segment anything,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.156549Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:bb6ec8812024365702c88934ad9e38ca2771d79a09de43398afc5ce384fb47d1","observation_id":"808ca6a7-f1cc-4b29-828d-6a2e237583af","resolution":{"observed_at":"2026-08-04T20:52:06.156549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-04T20:52:06.161060Z","title":"Dinov2: Learning robust visual features without supervision,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.161060Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:5a6faf9104ad6081e952e7b9fb171f911f851ccbfda513e8a9c97857fc7d4fb0","observation_id":"3b690062-15d8-4053-9c37-476f70e7730b","resolution":{"observed_at":"2026-08-04T20:52:06.161060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.165537Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.165537Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:927fe59146c1069b8c3efd49fc1a0787bf2dc0123d74a47e2db8608f22371087","observation_id":"ed7d736d-bf60-42b9-b47b-a6ce60c45e49","resolution":{"observed_at":"2026-08-04T20:52:06.165537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.170279Z","title":"Grounding dino: Marrying dino with grounded pre-training for VOLUME 00, 2024 27 Authoret al.: Preparation of Papers for IEEE OPEN JOURNALS open-set object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.170279Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:906c46bc3c3f8d126988b2fa62a7c352db174f0bd7428d220182ad25096a95f3","observation_id":"491988f0-11c5-474c-9803-79e69ab57e2d","resolution":{"observed_at":"2026-08-04T20:52:06.170279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.174614Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.174614Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:68bed5501860583fe6c949513fcf44f77c572069c9a447cbe14281fce15714cc","observation_id":"c087e1f2-c3d8-45da-b1b0-21f0d6b1d44b","resolution":{"observed_at":"2026-08-04T20:52:06.174614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.179142Z","title":"High-resolution image synthesis with latent diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.179142Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e6d5441b65c499c37442e39da7745cf6420b59f9e57dfc4aaa8fe979fc46606a","observation_id":"45984016-7677-47d3-96dd-fbc7e6d7a997","resolution":{"observed_at":"2026-08-04T20:52:06.179142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.183470Z","title":"Video diffusion models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.183470Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:6ec78efd2421e16a21117fd414c78fe2ef47b6b6eb39d4aeacf9dca4dbb7de23","observation_id":"06588573-edd6-4f41-82f2-8f80df7780c8","resolution":{"observed_at":"2026-08-04T20:52:06.183470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.188424Z","title":"3d shape generation and completion through point-voxel diffusion,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.188424Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:3041e4642141f90a52ceb5318a5ba72ed1b947b5b695dbd70079d5a406363834","observation_id":"cb6f5e0e-29a8-4af9-88d8-6d20ad38a38b","resolution":{"observed_at":"2026-08-04T20:52:06.188424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.193245Z","title":"Diffusion-based signed distance fields for 3d shape generation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.193245Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:470bb576ac59a67ad239c74bf04673c0f06605069cea7dc2859fd37b745878ce","observation_id":"254311b5-9d0d-4818-b96f-c978d422a22f","resolution":{"observed_at":"2026-08-04T20:52:06.193245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.198082Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.198082Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:039830f8a9d3ee7533ff18b7359590eb7010e569c4bab5864c23b6f4eacb99e5","observation_id":"1c0950a9-d402-41ed-875f-898878a7fcf2","resolution":{"observed_at":"2026-08-04T20:52:06.198082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.204799Z","title":"Image-to-lidar self-supervised distilla- tion for autonomous driving data,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.204799Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:6cd0d903637f7c9371d396f8a891b98908726000ab51ec7af649d5eb6563ea72","observation_id":"a6b6b936-605d-4ed9-a1ac-5a8190f8a493","resolution":{"observed_at":"2026-08-04T20:52:06.204799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.209914Z","title":"Segment any point cloud sequences by distilling vision foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.209914Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ae3b13f8138b8233cf6b76bad04a5d9401b6ffecf2285ad870d5caac73a39507","observation_id":"48a87cf9-5322-4f28-b184-8470b2895fb4","resolution":{"observed_at":"2026-08-04T20:52:06.209914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.214452Z","title":"Better call sal: Towards learning to segment anything in lidar,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.214452Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:6f4f9b1cb765f40767fe25590c23e877ad6463666478ad187f79487252178a7e","observation_id":"6b775d6d-9da4-45eb-9ceb-f1a6ea681d32","resolution":{"observed_at":"2026-08-04T20:52:06.214452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.219199Z","title":"Sam4udass: When sam meets unsupervised domain adaptive semantic segmentation in intelligent ve- hicles,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.219199Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:5ddcd16999a14ae204603995476ca6fa6c5ed5c59c1b0a0b20610956d6e01c72","observation_id":"6faf96f5-d14a-42f4-b8c5-6b7743b1559d","resolution":{"observed_at":"2026-08-04T20:52:06.219199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.226674Z","title":"Occnerf: Self-supervised multi- camera occupancy prediction with neural radiance fields,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.226674Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0ae595c7baa3defa7e9cf8bb0b7079a11841bb73912a25de0d1cac21eaaaa178","observation_id":"e9f52271-fced-471d-8acd-cf8a1584d203","resolution":{"observed_at":"2026-08-04T20:52:06.226674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10880","last_updated":"2024-08-20T14:10:44Z","snapshot_observed_at":"2026-07-06T19:03:30.963245Z","submitted_at":"2024-08-20T14:10:44Z","title":"Open 3D World in Autonomous Driving","version":1},"cited_work":{"arxiv_id":"2408.10880","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.10880","snapshot_observed_at":"2026-08-04T20:52:07.498826Z","title":"Open 3D World in Autonomous Driving","venue":"cs.CV","work_id":"ee4898d2-c0a0-4a16-9de9-b115c52cff7b","year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.234374Z"},"links":{"cited_paper":"/paper/2408.10880","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4bd727211db27e9491b5245944ad2a697c8fe1c2efffc2449504a219ade5b7f5","observation_id":"a46554fc-03ac-48d2-9dd0-7cc169d2c97d","resolution":{"observed_at":"2026-08-04T20:52:07.504246Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16133","last_updated":"2023-06-14T17:30:54Z","snapshot_observed_at":"2026-07-06T15:33:23.984280Z","submitted_at":"2023-05-25T15:07:25Z","title":"OVO: Open-Vocabulary Occupancy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16133","snapshot_observed_at":"2026-08-04T20:52:06.241136Z","title":"Ovo: Open-vocabulary occupancy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.241136Z"},"links":{"cited_paper":"/paper/2305.16133","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:77928de0f158622a4648f87a92a0bf51b45b5dcc3ff87fac891d446a45afad96","observation_id":"f9188c8d-3d07-49f5-bccb-eeb23a512c27","resolution":{"observed_at":"2026-08-04T20:52:06.241136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.246751Z","title":"Clip2scene: Towards label-efficient 3d scene understanding by clip,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.246751Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7e0d25cc868c47f46d50f7f706eb043c5751c99d968165b750d474079ce0a091","observation_id":"3efc75fb-904e-4f13-b4a2-75e4c755c603","resolution":{"observed_at":"2026-08-04T20:52:06.246751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.251773Z","title":"Vlm2scene: Self- supervised image-text-lidar learning with foundation models for autonomous driving scene understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.251773Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:1eb8450020d990b794bccfe16bc7ac2a13bbc4f0e0bbd66b724a5227951a6ec3","observation_id":"1ed4d6d4-5cfb-4759-88dd-7b6a889fd293","resolution":{"observed_at":"2026-08-04T20:52:06.251773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.256601Z","title":"Unsupervised 3d perception with 2d vision-language distillation for autonomous driv- ing,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.256601Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9052a032b9a4ffcf7e981c9d72e07d68cfe346daef03102a52d9abf29077fc51","observation_id":"04225145-4aa3-4e2d-b62a-7ca4a398a769","resolution":{"observed_at":"2026-08-04T20:52:06.256601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.261543Z","title":"Opensight: A simple open-vocabulary framework for lidar-based object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.261543Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:841cf8f5037b57518af0d42186c4f95915caa06cf6ff6eec1d4442376a47b93c","observation_id":"27d822af-a0f7-4591-9dcb-8509cecbd4bf","resolution":{"observed_at":"2026-08-04T20:52:06.261543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.02245","last_updated":"2024-01-29T12:14:04Z","snapshot_observed_at":"2026-07-06T15:37:39.433980Z","submitted_at":"2023-06-04T03:09:21Z","title":"SAM3D: Zero-Shot 3D Object Detection via Segment Anything Model","version":2},"cited_work":{"arxiv_id":"2306.02245","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.02245","snapshot_observed_at":"2026-08-04T20:52:07.460714Z","title":"SAM3D: Zero-Shot 3D Object Detection via Segment Anything Model","venue":"cs.CV","work_id":"d5524595-1d10-491a-b9e2-4845329ec30f","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.267283Z"},"links":{"cited_paper":"/paper/2306.02245","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7568927bc9c742e84bc42120ead001c9d16f0ff520c4298f5916bd494cdbc98e","observation_id":"f0edd2f8-565c-4683-b2e1-15f3c2bc8e0a","resolution":{"observed_at":"2026-08-04T20:52:07.465345Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01415","last_updated":"2023-12-05T05:26:29Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:57Z","title":"GPT-Driver: Learning to Drive with GPT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01415","snapshot_observed_at":"2026-08-04T20:52:06.272252Z","title":"Gpt- driver: Learning to drive with gpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.272252Z"},"links":{"cited_paper":"/paper/2310.01415","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ffcb4c1b91031e340b0e0867a69d69b489e604d0f3c32c30c6b9528f32aa9ee3","observation_id":"6545c1ab-899f-40ff-971a-1f30917478df","resolution":{"observed_at":"2026-08-04T20:52:06.272252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01533","last_updated":"2025-04-16T15:12:21Z","snapshot_observed_at":"2026-08-07T03:24:13.032388Z","submitted_at":"2024-05-02T17:59:24Z","title":"OmniDrive: A Holistic Vision-Language Dataset for Autonomous Driving with Counterfactual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01533","snapshot_observed_at":"2026-08-04T20:52:06.279971Z","title":"Omnidrive: A holistic llm-agent framework for autonomous driving with 3d perception, reasoning and planning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.279971Z"},"links":{"cited_paper":"/paper/2405.01533","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:02652f79bb8eeeace194e398b96687e79362da29477feb261d318f5b13678000","observation_id":"ab1bbacd-b53e-48fb-bb5b-3d99c6f92b34","resolution":{"observed_at":"2026-08-04T20:52:06.279971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.285794Z","title":"Drivegpt4: Interpretable end-to-end autonomous driving via large language model,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.285794Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:e2c39874fe0ebe1dfe8d0c23b0b3c1f399dbfbe68a71468f3ce6e97ed327f282","observation_id":"2c0a3865-ec48-4065-8669-aaee8b2ef20e","resolution":{"observed_at":"2026-08-04T20:52:06.285794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.290926Z","title":"Dol- phins: Multimodal language model for driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.290926Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:29c53a83273ce6d9d64aa104f3fb6a8c1e0697067f899e9106ca543af0c38fba","observation_id":"e5bb838d-6f68-4829-a109-84ab3eec627f","resolution":{"observed_at":"2026-08-04T20:52:06.290926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.23262","last_updated":"2025-09-23T04:19:59Z","snapshot_observed_at":"2026-08-05T06:31:46.069300Z","submitted_at":"2024-10-30T17:46:31Z","title":"EMMA: End-to-End Multimodal Model for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.23262","snapshot_observed_at":"2026-08-04T20:52:06.295417Z","title":"Emma: End-to- end multimodal model for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.295417Z"},"links":{"cited_paper":"/paper/2410.23262","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b7db481ae553376a743eb92760222f13dcef5311fe8c199ea458625021356641","observation_id":"3598c952-d75e-4441-ae7e-319b1ece4b4f","resolution":{"observed_at":"2026-08-04T20:52:06.295417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.299745Z","title":"Lidar-llm: Exploring the potential of large language models for 3d lidar understanding,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.299745Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:16d731f885c67776e8615cd221bf78d8bcadec274b5fdbea1ec0dd9a2b377363","observation_id":"5e4f1d86-3b82-4191-9958-3027096e23f7","resolution":{"observed_at":"2026-08-04T20:52:06.299745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.304116Z","title":"A survey on hallucination in large language mod- els: Principles, taxonomy, challenges, and open ques- tions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.304116Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:41c4aa8502d945dbeb38cd279d79f5eb940cf86268c3152e3b63c8990853c8ca","observation_id":"1c1f6882-564a-4c43-bfa7-9e01b4c0f605","resolution":{"observed_at":"2026-08-04T20:52:06.304116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.308606Z","title":"Retrieval-augmented genera- tion for knowledge-intensive nlp tasks,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.308606Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:14a7dddcff9a6c7cca9e7d6f5c017f5db898556d59a4ba78fa4c13132ad843bd","observation_id":"977244c2-3572-457e-ba6a-ed1b2b120fdc","resolution":{"observed_at":"2026-08-04T20:52:06.308606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.313814Z","title":"Self-rag: Learning to retrieve, generate, and critique through self-reflection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.313814Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:d8ba6f41bcef45722f51e95930353b9640d125916314229db8ab90b4603f7d41","observation_id":"703757cb-f79b-48ae-a467-4b4bd68e965e","resolution":{"observed_at":"2026-08-04T20:52:06.313814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.320327Z","title":"Driving with llms: Fusing object-level vector modal- ity for explainable autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.320327Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b4d621dc53f77a883f5747e99ecf34ce49ded5eb4be99ef1fcec236088936cb3","observation_id":"73b7e1da-1908-430c-a002-6ffd354230d4","resolution":{"observed_at":"2026-08-04T20:52:06.320327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.324944Z","title":"A survey on occupancy perception for autonomous driv- ing: The information fusion perspective,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.324944Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:92ff8744e72695f59684ed63ad55463899fdf731b70d8f4d1f3e260ea4a353af","observation_id":"001be390-273c-42c5-9086-c894ec33fd87","resolution":{"observed_at":"2026-08-04T20:52:06.324944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.331586Z","title":"Neural vol- umetric world models for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.331586Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4bc663e341622b8e6e804373b7369061a8367471f8b6f12d62ae2a14b886aba0","observation_id":"1479719f-f425-4895-b9df-12cec0af5abb","resolution":{"observed_at":"2026-08-04T20:52:06.331586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.336689Z","title":"Tri-perspective view for vision-based 3d semantic oc- cupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.336689Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:868e776d57d4c6e2202546ad930cddba6a83071fcfa018f157ba2b100bb784f9","observation_id":"34593224-8340-4434-88b9-dcf1ba67067f","resolution":{"observed_at":"2026-08-04T20:52:06.336689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.341604Z","title":"V oxformer: Sparse voxel transformer for camera-based 3d se- mantic scene completion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.341604Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9c6ef3b0217f0752c03cd7ac103e80607e792e7f64cdae8b0d528725a1556322","observation_id":"82f575c2-6de9-438b-9b6d-0f9a26cb95d1","resolution":{"observed_at":"2026-08-04T20:52:06.341604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.348253Z","title":"Occformer: Dual-path transformer for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.348253Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:eae9ada0299692438daababfbe5f6f3a24fdb8cddf3ad32b981f5f1b13f2a2df","observation_id":"65acb063-59a9-4f83-be6d-2983ad8596a0","resolution":{"observed_at":"2026-08-04T20:52:06.348253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.353724Z","title":"Fully sparse 3d occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.353724Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:8dbd3f5e4c3697a79efc829030b36ef900b2e291a54aeab71ff999ad4fdd3696","observation_id":"30f16fba-7139-4035-b7a9-0c136bee422f","resolution":{"observed_at":"2026-08-04T20:52:06.353724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.363094Z","title":"Hybridocc: Nerf enhanced transformer-based multi- camera 3d occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.363094Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9065c969feadf27dc2fa39da6a463fe3ed416b1e0cd3ca50d46e8f953f1b7ae7","observation_id":"9ffaaa56-33af-47de-b459-9b0f51844400","resolution":{"observed_at":"2026-08-04T20:52:06.363094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.368464Z","title":"Renderocc: Vision- centric 3d occupancy prediction with 2d rendering supervision,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.368464Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4226b44396bd37d6e301a250328c7ef7a940de85e37b8dc3d1b7626c21e48a5b","observation_id":"4615e532-1b5b-4770-9edd-3de223996b30","resolution":{"observed_at":"2026-08-04T20:52:06.368464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.375736Z","title":"S-nerf++: Autonomous driving simu- lation via neural reconstruction and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.375736Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4feb26ec0be40f26eb4c6e4a63f097e99490b62d999bd0e212f4f818cb34201a","observation_id":"be6922b5-27bf-4b10-a3f6-a4516abf7fb0","resolution":{"observed_at":"2026-08-04T20:52:06.375736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.387522Z","title":"Selfocc: Self-supervised vision-based 3d occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.387522Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:dae4262ac4347b847d553bad8744f723d5fafd90863628973b5f35d6bc986cf1","observation_id":"d5c805ad-40d8-4c26-9740-77783c7ae86f","resolution":{"observed_at":"2026-08-04T20:52:06.387522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.11356","last_updated":"2025-02-13T05:20:48Z","snapshot_observed_at":"2026-07-06T19:16:51.512681Z","submitted_at":"2024-09-17T17:00:52Z","title":"RenderWorld: World Model with Self-Supervised 3D Label","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11356","snapshot_observed_at":"2026-08-04T20:52:06.391983Z","title":"Renderworld: World model with self-supervised 3d label,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.391983Z"},"links":{"cited_paper":"/paper/2409.11356","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:8f301de88e41b6f4a7e93c6ec5afb6eefb73172864ad010ef629db657018dd70","observation_id":"a473cd25-a1ab-4d80-8798-767ed4d65a06","resolution":{"observed_at":"2026-08-04T20:52:06.391983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17288","last_updated":"2025-08-25T07:44:26Z","snapshot_observed_at":"2026-08-07T17:52:50.015358Z","submitted_at":"2025-02-24T16:16:01Z","title":"GaussianFlowOcc: Sparse and Weakly Supervised Occupancy Estimation using Gaussian Splatting and Temporal Flow","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17288","snapshot_observed_at":"2026-08-04T20:52:06.396798Z","title":"Gaussian- flowocc: Sparse and weakly supervised occupancy es- timation using gaussian splatting and temporal flow,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.396798Z"},"links":{"cited_paper":"/paper/2502.17288","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:84c10a4df92b130c74d778eed54f4858953a10ed07fd9055bf2305787cf7db7b","observation_id":"1d99020e-7f55-40ca-b8d5-8c61fb58add6","resolution":{"observed_at":"2026-08-04T20:52:06.396798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.404842Z","title":"Street gaussians: Modeling dynamic urban scenes with gaussian splat- ting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.404842Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7c29bbbe0ac05e38879edb10f016e011bc751164e08bae6cc0debfd706b12982","observation_id":"24b1a303-cb16-4c99-a1b9-33942cd6e303","resolution":{"observed_at":"2026-08-04T20:52:06.404842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.412278Z","title":"Gaussianformer: Scene as gaussians for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.412278Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:189ac289a9cf2d942dbd791a3e1715a2cf55515ef3b278af7822c892fd42abb9","observation_id":"d704555e-22fb-4d26-89bc-67fec162f7df","resolution":{"observed_at":"2026-08-04T20:52:06.412278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.419424Z","title":"Surroundocc: Multi-camera 3d occupancy pre- diction for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.419424Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:33922cc6b87850ecdd610df423c5f0d8fa809f885c98f58ce15073c557e04eef","observation_id":"2e9902a1-753f-4e91-9b0d-b471be8fa350","resolution":{"observed_at":"2026-08-04T20:52:06.419424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.430373Z","title":"Uno: Unsupervised occupancy fields for per- ception and forecasting,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.430373Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:7cd76a04452bf26a65cf50a569cace5bdad52152a963405a22745b1177b356d3","observation_id":"1c398fed-632f-4b0f-9b3b-a027bdf1a06d","resolution":{"observed_at":"2026-08-04T20:52:06.430373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.440273Z","title":"Maeli: Masked au- toencoder for large-scale lidar point clouds,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.440273Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:8b056eb05aa1eff11d4565878143ad9e2a4a60cf0d37079b08eab336c0fb6e7f","observation_id":"b2d0919c-459d-47d2-9266-e11f47851c21","resolution":{"observed_at":"2026-08-04T20:52:06.440273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.454199Z","title":"Masked autoencoder for self-supervised pre-training on lidar point clouds,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.454199Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:b65055dc6be1ce184e5c2553a0ba23d9326b82ec2be54b6c778efc5288af1a9d","observation_id":"a71e55e2-ee72-4f0e-9534-fc3aeab6833b","resolution":{"observed_at":"2026-08-04T20:52:06.454199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:06.461440Z","title":"Bev-mae: Bird’s eye view masked autoencoders for point cloud pre-training in autonomous driving sce- narios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.461440Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c1dfc37a0ebc36945ac75781370652cb5c4189c2836f25c8d371d0f5ab357f1f","observation_id":"ad181b6e-cb92-4571-a1b0-7d6603404a52","resolution":{"observed_at":"2026-08-04T20:52:06.461440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.910341Z","title":"Geo- mae: Masked geometric target prediction for self- supervised point cloud pre-training,","venue":null,"work_id":"65bc0eac-f47e-4c80-8cae-00897b563a66","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.466253Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:3adad9d59306774cde08d018e022681c2020149adb34ab4ccd85d84d92236767","observation_id":"717ed5c5-dc35-4283-81b9-1c546ed7bbf2","resolution":{"observed_at":"2026-08-04T20:52:11.958701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.827599Z","title":"Openoccupancy: A large scale benchmark for surrounding semantic oc- cupancy perception,","venue":null,"work_id":"1e200f5e-f91d-4a2a-bf43-8c7b94ab006f","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.473340Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:dbd45602e7d548cf782ee78e20f30302a1ab583c6c40316a2dde01857fd9109d","observation_id":"2cb009e3-6fad-4b92-af25-a0e5f5d355db","resolution":{"observed_at":"2026-08-04T20:52:11.853318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.691128Z","title":"Occ3d: A large-scale 3d occu- pancy prediction benchmark for autonomous driving,","venue":null,"work_id":"39405f54-2763-4d6e-b24d-a15134e5448d","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.479214Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ebfead1504ad4e4cb5686bbe74352fd8bbd6049f96fdcba9595d109b6a578caf","observation_id":"f6a9f70f-24ed-4655-8ec9-92d3e3846131","resolution":{"observed_at":"2026-08-04T20:52:11.741657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-04T20:52:06.484270Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.484270Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:8fff68434bfc6f56c0c1204e09272cfa7a8e434379d5e8aadeb27d1c5393c433","observation_id":"f207edd4-de38-4471-a912-3265676c83f5","resolution":{"observed_at":"2026-08-04T20:52:06.484270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.577117Z","title":"Cross-modal contrastive learning for domain adap- tation in 3d semantic segmentation,","venue":null,"work_id":"667bec92-00b8-48b6-9e3c-ce96810147ae","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.490510Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:4dd390e447f124b229984a82eabcc32742d597730c79816c1b8a26fee967e454","observation_id":"64004ea8-13af-4853-be77-bf72b6e0d902","resolution":{"observed_at":"2026-08-04T20:52:11.602627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.467968Z","title":"4d contrastive superflows are dense 3d representation learners,","venue":null,"work_id":"b47e55ba-674f-4504-9ecf-a97266a106e3","year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.499824Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:0a9a40f7b3f77c07a148cef3ec7ef7a791106596f7d05039615c833319b7beb2","observation_id":"17f96b34-aa93-4c4c-bd53-8196ce44d4eb","resolution":{"observed_at":"2026-08-04T20:52:11.493586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.364639Z","title":"Superflow++: Enhanced spatiotemporal con- sistency for cross-modal data pretraining,","venue":null,"work_id":"5ffd8ed6-7649-4b79-b217-dc7c01a0af92","year":2025},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.505917Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:3300a96799b54e780ca925b4ce456ee5bee5eb1037f0829b2391de26832aec3d","observation_id":"e5ae1d23-a4cc-42f0-96be-6a0d24730c45","resolution":{"observed_at":"2026-08-04T20:52:11.409874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16873","last_updated":"2025-08-19T08:07:30Z","snapshot_observed_at":"2026-07-06T18:20:22.759333Z","submitted_at":"2024-05-27T06:43:12Z","title":"ContrastAlign: Toward Robust BEV Feature Alignment via Contrastive Learning for Multi-Modal 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16873","snapshot_observed_at":"2026-08-04T20:52:06.510402Z","title":"Contrastalign: Toward robust bev feature alignment via contrastive learning for multi-modal 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.510402Z"},"links":{"cited_paper":"/paper/2405.16873","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:29fcde5ac74eacd4de5393f516c6fdcbbb40c089c88f3b0c5bf6be07b4f42d6b","observation_id":"e51c080a-0dbe-4bfd-a2bc-371a2c3211e6","resolution":{"observed_at":"2026-08-04T20:52:06.510402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09386","last_updated":"2022-11-17T07:26:14Z","snapshot_observed_at":"2026-07-06T14:19:39.156008Z","submitted_at":"2022-11-17T07:26:14Z","title":"BEVDistill: Cross-Modal BEV Distillation for Multi-View 3D Object Detection","version":1},"cited_work":{"arxiv_id":"2211.09386","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.09386","snapshot_observed_at":"2026-08-04T20:52:07.302544Z","title":"BEVDistill: Cross-Modal BEV Distillation for Multi-View 3D Object Detection","venue":"cs.CV","work_id":"7cb12d1a-d641-4e6d-b62f-2a0cdeb611e8","year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.514900Z"},"links":{"cited_paper":"/paper/2211.09386","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:81fcd6d077f17474095171055d754ade0ca32518fa2f318a1561a0ad40d97e66","observation_id":"f7d3ad64-de83-4a49-9c0b-b076dc108545","resolution":{"observed_at":"2026-08-04T20:52:07.308999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.218838Z","title":"Distill- bev: Boosting multi-camera 3d object detection with cross-modal knowledge distillation,","venue":null,"work_id":"98248a80-458d-4eae-a978-572b1b8708db","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.519795Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:c34fe71b625d21d2313b3ef985a8fc95fb305a90c5be5566fb454c0e49a533f5","observation_id":"1fe045da-f0f8-46b0-8cf4-87fc20ed479b","resolution":{"observed_at":"2026-08-04T20:52:11.268784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03105","last_updated":"2023-04-07T16:31:07Z","snapshot_observed_at":"2026-07-06T15:12:57.672390Z","submitted_at":"2023-04-06T14:33:05Z","title":"Geometric-aware Pretraining for Vision-centric 3D Object Detection","version":2},"cited_work":{"arxiv_id":"2304.03105","doi":null,"metadata_source":"pith","pith_arxiv_id":"2304.03105","snapshot_observed_at":"2026-08-04T20:52:07.270148Z","title":"Geometric-aware Pretraining for Vision-centric 3D Object Detection","venue":"cs.CV","work_id":"16bfe2cc-e195-4d2f-99da-40da47383d26","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.524843Z"},"links":{"cited_paper":"/paper/2304.03105","citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:36d78c3babdde62cbf507c1f1999aec88da0b51d32114f6acf607d2d7654402c","observation_id":"e5b5c084-ceb6-4252-9a09-6123e0307ead","resolution":{"observed_at":"2026-08-04T20:52:07.279648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:11.075491Z","title":"Unidis- till: A universal cross-modality knowledge distillation framework for 3d object detection in bird’s-eye view,","venue":null,"work_id":"03236b47-6042-452c-8a8e-68794d630df7","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.530339Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:ac71cec627bd12c92e48c2f08cc5c4a5ec1fa667909a06dd7d828da4691f645e","observation_id":"6b67b156-6f08-49d4-8398-ee7bd8d43878","resolution":{"observed_at":"2026-08-04T20:52:11.129176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.939573Z","title":"Revisiting domain generalized stereo match- ing networks from a feature consistency perspec- tive,","venue":null,"work_id":"dfd8f8b0-911a-4393-986c-5b19f4b20feb","year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.535252Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:81773a5a55da40583f555acc35f75ee0875d7a7f0a2ab1d2c07cd2b426865ad6","observation_id":"2c0bd976-ee51-4a9c-8764-b69dcaafee5c","resolution":{"observed_at":"2026-08-04T20:52:10.988761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.796690Z","title":"Weakly supervised monocular 3d object detection using multi-view projection and direction consis- tency,","venue":null,"work_id":"04d6fc01-7747-44ed-9b9d-dc793beb1763","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.539772Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:75de9fc85604ee10d5cd8c0936e6378e34a735998b7af9b3d2aabd6d3d161103","observation_id":"aa4d1f90-2d62-4d39-93f3-c3222569a5c0","resolution":{"observed_at":"2026-08-04T20:52:10.852859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.688254Z","title":"Bevformer: learning bird’s-eye- view representation from lidar-camera via spatiotem- poral transformers,","venue":null,"work_id":"51746243-10a2-4953-b055-0ba0c1019848","year":2024},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.548022Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:3218508cc6d7be2c9f2e8b6a359211b781a859523b87ee0424b1515bea66038d","observation_id":"60efd1e8-6ef1-4470-9b09-ffaf730b17a8","resolution":{"observed_at":"2026-08-04T20:52:10.737724Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.536619Z","title":"Ega- depth: Efficient guided attention for self-supervised multi-camera depth estimation,","venue":null,"work_id":"04895f69-43b8-4f4b-855f-0b6d59d9e7b7","year":2023},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.554368Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:f3dd9b9e0da3eb8a992cee8eb6f636931d4d7b88b480ee6244df103bbc091c84","observation_id":"13f62e17-857c-4cc5-8769-e33ca9238a43","resolution":{"observed_at":"2026-08-04T20:52:10.597236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T20:52:10.374397Z","title":"Multimae: Multi-modal multi-task masked autoen- coders,","venue":null,"work_id":"6a0a81e2-aaec-4e7c-88d4-dd652bdfc432","year":2022},"citing_paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-04T20:52:06.559453Z"},"links":{"citing_paper":"/paper/2509.08302"},"observation_digest":"sha256:9f943eceefe31d72c7918a2cf9dc7b69b39896855b78f7cdd50f51492d92b518","observation_id":"e79ebaf7-1f1e-4b72-991a-0aa03f6a2c33","resolution":{"observed_at":"2026-08-04T20:52:10.430743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.08302","last_updated":"2025-09-10T05:45:49Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T03:24:45.987181Z","submitted_at":"2025-09-10T05:45:49Z","title":"Foundation Models for Autonomous Driving Perception: A Survey Through Core Capabilities"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":83,"verified_exact":4,"verified_fuzzy":13},"total_outbound_references":144},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 100 of 144 outbound references and 0 inbound Pith citation observations for arXiv:2509.08302."}