{"as_of":"2026-08-14T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:df532cdfd7797d0d0abdc7ff3d1fc892df1f2a97d4fa873ebedd11d40c59bd6a","coverage":[{"denominator":54,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":54,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:05:27.362145Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T01:59:16.251640Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T02:01:25.681466Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"cited_work":{"arxiv_id":"2411.14716","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.14716","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Visionpad: A vision-centric pre-training paradigm for autonomous driving","venue":null,"work_id":"2dfe089f-5fc5-45a2-9e38-144aa7143f1a","year":2024},"citing_paper":{"arxiv_id":"2512.03210","last_updated":"2026-05-04T05:09:42Z","snapshot_observed_at":"2026-08-14T07:58:05.453863Z","submitted_at":"2025-12-02T20:28:45Z","title":"Flux4D: Flow-based Unsupervised 4D Reconstruction","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T01:59:16.251640Z"},"links":{"cited_paper":"/paper/2411.14716","citing_paper":"/paper/2512.03210"},"observation_digest":"sha256:4e6db0570e8743cca17daf4d4b04a84d9fe4a704fb57d713f796ffde4642acf4","observation_id":"42612af9-ea0c-4ba2-b543-5b219ee4f4d0","resolution":{"observed_at":"2026-05-17T02:01:25.683602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.14716/citation-record","integrity":"/paper/2411.14716/integrity","json":"/paper/2411.14716/citation-record.json","paper":"/paper/2411.14716"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.986346Z","title":"ALSO: automotive lidar self- supervision by occupancy estimation","venue":null,"work_id":"93ffa93d-aa0d-443f-a44b-c4e62eef09ab","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.162166Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:61e0d6ec4d676902ad6e3996299e7ad37d83e63f37376f043d9bf257767287fe","observation_id":"6aa18881-9c91-4198-9ba5-ec4a4570edb5","resolution":{"observed_at":"2026-08-12T15:05:27.990546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.975204Z","title":"Lang, Sourabh V ora, Venice Erin Liong, Qiang Xu, Anush Krishnan, Yu Pan, Gi- ancarlo Baldan, and Oscar Beijbom","venue":null,"work_id":"268625f3-7554-445c-975f-82deaccfd3d2","year":2020},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.166625Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:a565e4ccee5d0080d8fb63239d21dc820fee7f959ad9ae8d6124404479e1ebeb","observation_id":"44b446bc-cc5f-4bb7-9ba8-5a0dba7f7946","resolution":{"observed_at":"2026-08-12T15:05:27.979309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.14108","last_updated":"2024-12-04T16:43:00Z","snapshot_observed_at":"2026-08-12T23:18:53.703607Z","submitted_at":"2024-07-19T08:24:36Z","title":"GaussianBeV: 3D Gaussian Representation meets Perception Models for BeV Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.14108","snapshot_observed_at":"2026-08-12T15:05:27.170569Z","title":"Gaussianbev: 3d gaussian representation meets percep- tion models for bev segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.170569Z"},"links":{"cited_paper":"/paper/2407.14108","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:a2b6500cb2187c421471c095c48db72da5ef8859f7e8690b6133b991ff95d0f1","observation_id":"32523c7e-23e3-449b-9568-9bbac70847ef","resolution":{"observed_at":"2026-08-12T15:05:27.170569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.964012Z","title":"pixelsplat: 3d gaussian splats from image pairs for scalable generalizable 3d reconstruction","venue":null,"work_id":"bbd927f4-52ca-46ca-906e-cf43ab5caa02","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.175223Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:86591e21a00f244506c773f203a2af069fcdd7a7c8ba58db3adf840fced6af1f","observation_id":"364d9dda-a1c3-405d-b6e4-669cea8f2498","resolution":{"observed_at":"2026-08-12T15:05:27.967870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18561","last_updated":"2025-08-23T01:56:43Z","snapshot_observed_at":"2026-08-13T05:13:26.949495Z","submitted_at":"2023-11-30T13:53:50Z","title":"Periodic Vibration Gaussian: Dynamic Urban Scene Reconstruction and Real-time Rendering","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18561","snapshot_observed_at":"2026-08-12T15:05:27.179157Z","title":"Periodic vibration gaussian: Dynamic urban scene reconstruction and real-time rendering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.179157Z"},"links":{"cited_paper":"/paper/2311.18561","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:64e197ff36a065a45d4161fab4d2fc232b9e9af930e1bbd07dc70b1d15be513e","observation_id":"8eea7ba1-caaa-41f6-9fae-5252d194ba42","resolution":{"observed_at":"2026-08-12T15:05:27.179157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.183375Z","title":"Gaussianpro: 3d gaussian splatting with progressive propagation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.183375Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:c7ebce472746bfc5eff4a0e6ffffe32c80a3992784f364359e196d550d372831","observation_id":"b38e2d77-f02b-4646-9620-213bc74216f0","resolution":{"observed_at":"2026-08-12T15:05:27.183375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.187557Z","title":"MMDetection3D: Open- MMLab next-generation platform for general 3D object detection","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.187557Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:5ddf1da860285da11e323e793f8f10b0b3db99c3259811bc1bce694b7be09bb4","observation_id":"b5b72d35-31ca-4ea2-869d-422cddf16f66","resolution":{"observed_at":"2026-08-12T15:05:27.187557Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.939350Z","title":null,"venue":null,"work_id":"697e773d-e710-4436-b961-15ad48e0adeb","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.191103Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:b38861a9907bbc8a2bca68b80215816ce71fd53305e2faa62ca0d978366d50f6","observation_id":"fedf35c9-25ba-4600-b167-292b5e65e2b1","resolution":{"observed_at":"2026-08-12T15:05:27.942940Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11447","last_updated":"2025-07-14T17:20:25Z","snapshot_observed_at":"2026-08-12T23:00:08.917050Z","submitted_at":"2024-08-21T09:06:30Z","title":"GaussianOcc: Fully Self-supervised and Efficient 3D Occupancy Estimation with Gaussian Splatting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.11447","snapshot_observed_at":"2026-08-12T15:05:27.194774Z","title":"Gaussianocc: Fully self-supervised and effi- cient 3d occupancy estimation with gaussian splatting.arXiv preprint arXiv: 2408.11447, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.194774Z"},"links":{"cited_paper":"/paper/2408.11447","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:80457ac41db0f6feac6fdae03a47d376330d272e4fb4567047edb561a077f146","observation_id":"b3ff89b9-ad5a-455f-9514-d4d324f85172","resolution":{"observed_at":"2026-08-12T15:05:27.194774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.198601Z","title":"Digging into self-supervised monocular depth estimation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.198601Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:594a1c17fd99319e12afc0eea432286c4e407895c5e2ae3448772ba1c875474e","observation_id":"9b0b4069-e556-435b-b94c-37a0b2dac1f7","resolution":{"observed_at":"2026-08-12T15:05:27.198601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.921330Z","title":"Planning-oriented autonomous driv- ing","venue":null,"work_id":"45ab9502-42f3-413f-8271-133b4a44e202","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.202410Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:0e65ada3319ea57e4cd4f2d97f97c49462076dcd15f019dbbda3709b0542659a","observation_id":"916b2e7e-76e6-4e23-be54-de7b1ffacc25","resolution":{"observed_at":"2026-08-12T15:05:27.925559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-12T15:05:27.206211Z","title":"Bevdet: High-performance multi-camera 3d object detection in bird-eye-view","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.206211Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:9cf0222b3642762b6c13323be7b6336b27d8caab5f4e4175cf2d43493cf6a799","observation_id":"0eddf914-42da-4150-ab07-76c9ac3658fe","resolution":{"observed_at":"2026-08-12T15:05:27.206211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.909784Z","title":"Tri-perspective view for vision- based 3d semantic occupancy prediction","venue":null,"work_id":"1936d44f-3351-4b33-ac6e-592a3ae9ea1b","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.210238Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:3f60b42bcae561261f9c0ba1e7a9dad2c08de41cfc250bc47e7e218deb2bebfd","observation_id":"c335db95-c393-495e-8087-40c28c78c88a","resolution":{"observed_at":"2026-08-12T15:05:27.913850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17429","last_updated":"2024-05-27T17:59:51Z","snapshot_observed_at":"2026-08-12T23:56:50.445264Z","submitted_at":"2024-05-27T17:59:51Z","title":"GaussianFormer: Scene as Gaussians for Vision-Based 3D Semantic Occupancy Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17429","snapshot_observed_at":"2026-08-12T15:05:27.213896Z","title":"Gaussianformer: Scene as gaussians for vision-based 3d semantic occupancy prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.213896Z"},"links":{"cited_paper":"/paper/2405.17429","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:46c3e2b77035c7ebaea87d3c0bc0f93bef036a5a8d022ebafe8002e7ab422901","observation_id":"beac3a8e-e369-458b-96cf-09dd9cd43e12","resolution":{"observed_at":"2026-08-12T15:05:27.213896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.897326Z","title":"Nerf-mae: Masked autoencoders for self-supervised 3d representation learning for neural radiance fields","venue":null,"work_id":"c97353e6-2efd-4a40-877f-e812f82b8044","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.218037Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:7380d5ca405cfe68bbf1edcc743d79e1c014d9a14954b5223b2649c03d781bff","observation_id":"67d713cc-7e4f-4c58-9197-877d90925caf","resolution":{"observed_at":"2026-08-12T15:05:27.901390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.221978Z","title":"3d gaussian splatting for real-time radiance field rendering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.221978Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:3f1a357d1f0218396ff215bd524af01611101c5d16a8df4f9b035f85c795e309","observation_id":"f3c37000-0a54-4416-8f8d-99939aeb0ad4","resolution":{"observed_at":"2026-08-12T15:05:27.221978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.879149Z","title":"Maeli: Masked autoencoder for large-scale lidar point clouds","venue":null,"work_id":"10a86655-a1ed-4ccf-9350-a18d515624c7","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.226043Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:e9700054a0a1cf366a9923ae55aacf8c2c4bdee2a57d3b7ec624fafef1f46e7f","observation_id":"5e45081c-65f6-4f5a-9663-f4f21306d076","resolution":{"observed_at":"2026-08-12T15:05:27.883157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.868102Z","title":"Unifying voxel-based representation with transformer for 3d object detection","venue":null,"work_id":"5c804631-a47f-4c91-97e1-b1f7efb2127d","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.229982Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:f6768e1a82891faf392fe33f87e9422f714121bc87c4ed2d190d0d0ba470add3","observation_id":"95bb179d-5273-4705-83c1-5e3fe8d5889a","resolution":{"observed_at":"2026-08-12T15:05:27.872005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.233686Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.233686Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:5c289ab57cda3f653351c20979dd3999999deaf07189f0f8858cfc077e79dc4c","observation_id":"eac0eb53-c7c9-4304-ba0b-0ac1bb817413","resolution":{"observed_at":"2026-08-12T15:05:27.233686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.851252Z","title":"Simipu: Simple 2d image and 3d point cloud un- supervised pre-training for spatial-aware visual representa- tions","venue":null,"work_id":"ff0b8edb-a43a-4608-bf85-4603aebb4575","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.237676Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:245d258a89127786cfd853299936275f3693a56dcbee2a2406fb06891ea60e51","observation_id":"4e9b9075-1a1d-4b0c-a118-522fdd1133b3","resolution":{"observed_at":"2026-08-12T15:05:27.855036Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.840539Z","title":"Bevformer: 9 Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"2a7b40b4-5973-42e7-964c-ea78d12794c4","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.241236Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:9088c0223070dfd99c0fc7268a51f9b41523782c04a88c8bc8588a6142c1bd1f","observation_id":"43ea415c-9bc2-49c8-878f-f7f5bfa6db9b","resolution":{"observed_at":"2026-08-12T15:05:27.844433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.829339Z","title":"Fb-occ: 3d occupancy prediction based on forward-backward view transformation","venue":null,"work_id":"c6b0c019-8dfb-48ec-bada-27338f4c650a","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.245115Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:7a462aaccfb447ba5fbfc6f77c49218cb28de2b8b2980b56b0ff0690dec642a5","observation_id":"098e1ebf-13ae-4cd8-8efe-c414cfbc80be","resolution":{"observed_at":"2026-08-12T15:05:27.833377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.817748Z","title":"Fully sparse 3d occupancy prediction","venue":null,"work_id":"c2f49991-f701-4d0f-9a84-e2ffa8a88474","year":null},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.248649Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:5aa2e0a70435629e2f82df625fd6cebc66274f442e6f9495e6923f4d379d3177","observation_id":"377dcf41-c935-4ebc-857b-33e47c637523","resolution":{"observed_at":"2026-08-12T15:05:27.821803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.805417Z","title":"PETR: position embedding transformation for multi-view 3d object detection","venue":null,"work_id":"4edb9306-ed24-4d16-975d-3514cd44877a","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.252268Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:b378cde87b7aa02681b0b6dff4ab485e45b1925902435e295bf86d3d6b5e1c4f","observation_id":"86fd28be-248a-4547-a518-7b5ac43312eb","resolution":{"observed_at":"2026-08-12T15:05:27.809763Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.793812Z","title":"A convnet for the 2020s","venue":null,"work_id":"4d89990c-fb02-45ba-aa31-3370f1c4ab09","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.255728Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:a3da78d7dfd9721b65642470c36c76b9dc74f7c8bcd58c2cbcbc1f8a98e78f61","observation_id":"11d79bf9-fe4e-4747-ae37-6c204346d9d6","resolution":{"observed_at":"2026-08-12T15:05:27.797683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.781300Z","title":"Learning ego 3d representation as ray tracing","venue":null,"work_id":"e577f1eb-37e2-45fb-8da7-b5316289de99","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.259402Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:9133924db3f70b5f7567077536fa02310cfe44923ec918c441225f771e3213c0","observation_id":"1968de2e-ded2-4e2e-b29e-bb6204b7e931","resolution":{"observed_at":"2026-08-12T15:05:27.785592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.768793Z","title":"Srinivasan, Matthew Tancik, Jonathan T","venue":null,"work_id":"80113729-0850-4017-aa9f-01632ed2ab59","year":2020},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.262909Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:1a6e7a7c7a543eb69920964b25a9aa05b117690d2123174f23905821351eacb0","observation_id":"0a75d406-cd44-413e-9288-0057978490ba","resolution":{"observed_at":"2026-08-12T15:05:27.772732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.09900","last_updated":"2023-10-09T12:34:02Z","snapshot_observed_at":"2026-08-13T15:20:07.598457Z","submitted_at":"2022-06-20T17:15:50Z","title":"Occupancy-MAE: Self-supervised Pre-training Large-scale LiDAR Point Clouds with Masked Occupancy Autoencoders","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.09900","snapshot_observed_at":"2026-08-12T15:05:27.266517Z","title":"V oxel-mae: Masked autoencoders for pre-training large-scale point clouds","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.266517Z"},"links":{"cited_paper":"/paper/2206.09900","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:5d2977f711fac38e145d29693d69d13756f3e3574c9615cb0801edf7a003b399","observation_id":"d3440214-7ec2-433a-9352-7229afe9559a","resolution":{"observed_at":"2026-08-12T15:05:27.266517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.754965Z","title":"Occupancy-mae: Self-supervised pre-training large- scale lidar point clouds with masked occupancy autoen- coders","venue":null,"work_id":"619582de-bdb7-42cf-a61b-14845cc8763a","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.269898Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:9d92a9eb369324d7a48d496552fdc9aa313d2ae53de70a83c22ae44902656ae0","observation_id":"e9304f3a-0c36-415f-ac8e-3e88144a545e","resolution":{"observed_at":"2026-08-12T15:05:27.759678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.741123Z","title":"Segcontrast: 3d point cloud feature representation learning through self-supervised seg- ment discrimination","venue":null,"work_id":"fd24637e-43eb-44a8-9cb1-0910f95be855","year":2022},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.273588Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:fa72a663581f932e58cd26ebe1f1c1ef5f5e4d499f359296e0cc2ed5deb269b7","observation_id":"e62b69de-5654-4eb0-a3f0-1b139c2b025b","resolution":{"observed_at":"2026-08-12T15:05:27.745396Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.729810Z","title":"Renderocc: Vision-centric 3d occupancy pre- diction with 2d rendering supervision","venue":null,"work_id":"f626c689-02bd-4a1f-9def-dfbce1140fc5","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.277305Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:f93acbb6ad4f34e4fd8e9906f52a19b8376c2d326ffa99c7f418a0e02d96b772","observation_id":"2cb62c01-bad2-4606-a181-191bf402a020","resolution":{"observed_at":"2026-08-12T15:05:27.733778Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.280812Z","title":"Is pseudo-lidar needed for monocular 3d object detection? In Proceedings of the IEEE/CVF Inter- national Conference on Computer Vision, pages 3142–3152,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.280812Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:1e312f9069f335489d6c92cc05ce36b430bb4cefdf684d7c4df12e95b63ac54a","observation_id":"bf5ff595-6865-4b10-a764-9f8e63014d23","resolution":{"observed_at":"2026-08-12T15:05:27.280812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.708945Z","title":"BEVContrast: Self-supervision in bev space for automotive lidar point clouds","venue":null,"work_id":"c2021b12-4776-4fe0-91d6-9eb68a1dbe8a","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.284207Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:fd9ce929c464b6cac250714c3e478706c2f3ac4844e1899801d911773dacdacf","observation_id":"65fbab39-a80b-4f6d-86b5-af7c3848ba3b","resolution":{"observed_at":"2026-08-12T15:05:27.713543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.695383Z","title":"3dppe: 3d point positional encoding for multi-camera 3d ob- ject detection transformers","venue":null,"work_id":"7467204a-c39e-4dd5-a520-00b2d71d993d","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.287586Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:cf5b7a235ea3526c8faaf4de242e857b6da40965e5b06e5a6414a8d88701f728","observation_id":"d216e97f-d406-4719-89f6-905f7aed8f78","resolution":{"observed_at":"2026-08-12T15:05:27.700033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.683487Z","title":"Sparseocc: Re- thinking sparse latent representation for vision-based seman- tic occupancy prediction","venue":null,"work_id":"cc946f1c-b123-4b21-a998-1da72fe6b1f7","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.291176Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:74373f0e979e2b3e6d87f9c31d30bab5470e5b1ba74c5dbeea526b1b0f488809","observation_id":"5b95f62a-1da0-4832-b2e3-5134d95c2f1f","resolution":{"observed_at":"2026-08-12T15:05:27.687493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.671567Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for autonomous driving","venue":null,"work_id":"8024b12f-fc3f-41c3-8c08-6ed4e807e53c","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.294803Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:54f7123fcf16d68283c9797276d86044553781de93e6735876637f63495c8c35","observation_id":"72f9ee61-f12f-4a46-9bf9-4ece5f3170d5","resolution":{"observed_at":"2026-08-12T15:05:27.675621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.298136Z","title":"Scene as occupancy","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.298136Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:4469a88ad88c067f79f9b040412e64fbbb0371dab61b7670b11c5bf85bb5fbbd","observation_id":"f5f41528-31e7-4f6e-b302-11c24e52979f","resolution":{"observed_at":"2026-08-12T15:05:27.298136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.650702Z","title":"Opus: occupancy prediction using a sparse set","venue":null,"work_id":"3feafa9a-d154-410c-bcc9-a88555c80e54","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.301497Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:8838010c654570f068f10f282954ecc2b0334b4fb609da7a90d2f4e1293b8b11","observation_id":"5198f398-2c1f-45a7-88e7-04ec9d3df602","resolution":{"observed_at":"2026-08-12T15:05:27.655341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.639350Z","title":"Fcos3d: Fully convolutional one-stage monocular 3d object detection","venue":null,"work_id":"0685581b-7ca7-41c3-a6b6-b6a8c8d40e14","year":2021},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.305041Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:701681fb61f56efd0da528652c9385ef92cc0ab9b0cee67dd3494d8d84df3757","observation_id":"bd4eaec4-fa88-449a-9cb0-7cc9b50c78b0","resolution":{"observed_at":"2026-08-12T15:05:27.643571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.624295Z","title":"Openoccupancy: A large scale benchmark for surrounding semantic occupancy perception","venue":null,"work_id":"7c64d49a-a5b4-4022-930a-b1b14f075002","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.308616Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:ff313a6a38919c47fa55182000aab04130ca69b0ebac63a242d797e46812aa0c","observation_id":"6f9e0367-fec3-43f0-a83f-8fb675511538","resolution":{"observed_at":"2026-08-12T15:05:27.629682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.612290Z","title":"Cross modal transformer via coordinates encoding for 3d object dectection","venue":null,"work_id":"a2d3982f-4d21-41f2-910a-742bb734e8ed","year":null},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.312339Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:58f8bbf48b331e7b797465e3c054d4303435046925a11860698a1895c45028b1","observation_id":"befcdced-425b-4aa2-8bbc-c27033a9dd55","resolution":{"observed_at":"2026-08-12T15:05:27.616552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10527","last_updated":"2025-07-16T08:17:09Z","snapshot_observed_at":"2026-08-13T10:10:04.975619Z","submitted_at":"2023-09-19T11:13:01Z","title":"SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations","version":4},"cited_work":{"arxiv_id":"2309.10527","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.10527","snapshot_observed_at":"2026-08-12T15:05:27.454714Z","title":"SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations","venue":"cs.CV","work_id":"e43ab8a2-b41f-41de-9e05-60b734591306","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.316012Z"},"links":{"cited_paper":"/paper/2309.10527","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:3f9bfef4ad408e8dd3e5b8268237b93f9ebe1812f53167c2d467abfa0f96e1e8","observation_id":"656bbc4b-a1d4-4b23-bd45-445b060157d9","resolution":{"observed_at":"2026-08-12T15:05:27.459509Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08045","last_updated":"2024-01-16T01:57:24Z","snapshot_observed_at":"2026-08-13T04:42:23.319648Z","submitted_at":"2024-01-16T01:57:24Z","title":"Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08045","snapshot_observed_at":"2026-08-12T15:05:27.319583Z","title":"Forging vision foundation models for autonomous driving: Challenges, methodologies, and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.319583Z"},"links":{"cited_paper":"/paper/2401.08045","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:f487b41ee7509e6a8b183c85856d9905935c62f7af1ef8da9b4fd9f8a046c12f","observation_id":"8d289ecb-128c-4847-b39b-9a2608a3034e","resolution":{"observed_at":"2026-08-12T15:05:27.319583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01339","last_updated":"2024-08-18T14:26:31Z","snapshot_observed_at":"2026-08-13T04:49:57.842976Z","submitted_at":"2024-01-02T18:59:55Z","title":"Street Gaussians: Modeling Dynamic Urban Scenes with Gaussian Splatting","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01339","snapshot_observed_at":"2026-08-12T15:05:27.323607Z","title":"Street gaussians for modeling dynamic ur- ban scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.323607Z"},"links":{"cited_paper":"/paper/2401.01339","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:e97dec3fd4ba74feacbe8f3351b3bd499e2dfed6eeed29579aa95d4c2af05ae8","observation_id":"2e8f9ebd-155d-4b75-bfd3-bd65ba0b3416","resolution":{"observed_at":"2026-08-12T15:05:27.323607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.599248Z","title":"Bevformer v2: Adapting modern image backbones to bird’s-eye-view recognition via perspective supervision","venue":null,"work_id":"9ec86a6e-9803-416b-ad2b-3255f470b0ba","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.328573Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:8af213908862fd91e65ac67c3acfd660211d430f778d52850fd7c8260787ab95","observation_id":"4707a4ac-6400-442b-990b-eb6ce7df8164","resolution":{"observed_at":"2026-08-12T15:05:27.603727Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.585211Z","title":"Unipad: A universal pre-training paradigm for autonomous driving","venue":null,"work_id":"077af0b1-7237-42fe-b102-6c186c8c0f52","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.332025Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:f508fb39fb1aa38d9e4d9232e7a11adaeda7396a7b60a863dc9c228f0a8d8880","observation_id":"c9c3ce52-b2ec-4e16-8d1d-0c078af174ff","resolution":{"observed_at":"2026-08-12T15:05:27.589686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.573194Z","title":"Visual point cloud forecasting enables scalable autonomous driving","venue":null,"work_id":"2ac18aaa-e054-4942-98ff-e5b4d1ac4a5a","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.335585Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:1d63568c72adb0e6f56066a82413ae9479c782905fd418da96ed0047ae957b2d","observation_id":"7fc07850-f963-4f17-8002-fa91e2da01d7","resolution":{"observed_at":"2026-08-12T15:05:27.577009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.562142Z","title":"Ad-pt: Autonomous driving pre-training with large-scale point cloud dataset","venue":null,"work_id":"4b1ea53e-e2c9-4b0e-aaa9-366460a0ffee","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.338784Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:c0e2c73bad4648c3ff9eba3e05992fe90544283979b0d4a5f35799ac5caeb0f0","observation_id":"94a9b3b0-098f-4769-9ab1-63ec187a6663","resolution":{"observed_at":"2026-08-12T15:05:27.565893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.05679","last_updated":"2025-04-30T13:43:51Z","snapshot_observed_at":"2026-08-12T23:27:01.708830Z","submitted_at":"2024-07-08T07:26:08Z","title":"BEVWorld: A Multimodal World Simulator for Autonomous Driving via Scene-Level BEV Latents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.05679","snapshot_observed_at":"2026-08-12T15:05:27.342139Z","title":"Bevworld: A multimodal world model for au- tonomous driving via unified bev latent space.arXiv preprint arXiv:2407.05679, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.342139Z"},"links":{"cited_paper":"/paper/2407.05679","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:8ae0f838460e57a6143667584b1cadb8eebe6521e51248ac7bfeed1df11ef4d2","observation_id":"5a445193-deb4-44c1-8a0f-1fded900b4ce","resolution":{"observed_at":"2026-08-12T15:05:27.342139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.549715Z","title":"Radocc: Learning cross-modality occupancy knowledge through ren- dering assisted distillation","venue":null,"work_id":"33e66f2f-6b15-4f44-951a-dff992ded5c8","year":2023},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.346075Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:dcc69e298cf99a384bf9ebf27f278661c86b1cf8b3ee7c0a9c66bc01b3a7c5dc","observation_id":"1c66db66-0e73-4b5f-899c-dee36e580ca5","resolution":{"observed_at":"2026-08-12T15:05:27.554208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.537513Z","title":"Hugs: Holistic urban 3d scene understanding via gaus- sian splatting","venue":null,"work_id":"5bea0364-5b21-46b2-b0cc-1a75ec72bdf3","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.350412Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:cdf126407a7ff0a713b2b2f188e56afcfa58de43bf40eaf161eae7cf5b760b22","observation_id":"7a88f6a2-edf0-49e9-83e9-c4a5585f7d03","resolution":{"observed_at":"2026-08-12T15:05:27.541582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:05:27.354297Z","title":"Drivinggaussian: Composite gaussian splatting for surrounding dynamic au- tonomous driving scenes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.354297Z"},"links":{"citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:a91a1663ce7210f37606dd9e908b353276453b24df2d2b4d64b5e8e55c188a68","observation_id":"02d46c52-78ae-4cf2-8904-252f418a856d","resolution":{"observed_at":"2026-08-12T15:05:27.354297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09492","last_updated":"2019-08-26T06:27:01Z","snapshot_observed_at":"2026-08-10T20:08:05.494461Z","submitted_at":"2019-08-26T06:27:01Z","title":"Class-balanced Grouping and Sampling for Point Cloud 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09492","snapshot_observed_at":"2026-08-12T15:05:27.358066Z","title":"Class-balanced grouping and sampling for point cloud 3d object detection","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.358066Z"},"links":{"cited_paper":"/paper/1908.09492","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:1ae28795bebbdf088ebb2e72f3c332577dbd307d88e90bc70d67f3c4ebe937fd","observation_id":"d8316332-66dd-46a4-8b7b-6ca159295ba6","resolution":{"observed_at":"2026-08-12T15:05:27.358066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08760","last_updated":"2024-03-13T17:58:00Z","snapshot_observed_at":"2026-08-13T00:54:55.180081Z","submitted_at":"2024-03-13T17:58:00Z","title":"MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning","version":1},"cited_work":{"arxiv_id":"2403.08760","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.08760","snapshot_observed_at":"2026-08-12T15:05:27.393436Z","title":"MIM4D: Masked Modeling with Multi-View Video for Autonomous Driving Representation Learning","venue":"cs.CV","work_id":"e1c07a05-aa84-42fe-9be4-56345dae44ed","year":2024},"citing_paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T15:05:27.362145Z"},"links":{"cited_paper":"/paper/2403.08760","citing_paper":"/paper/2411.14716"},"observation_digest":"sha256:0f6b83edace468225e8d496b259b282d6e41c3e8da2da1eda37beb71ed5b9274","observation_id":"92d8d6a5-fac6-4d1e-96b3-b4d0aea5bc2c","resolution":{"observed_at":"2026-08-12T15:05:27.399830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14716","last_updated":"2025-05-22T03:33:08Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T10:48:08.581062Z","submitted_at":"2024-11-22T03:59:41Z","title":"VisionPAD: A Vision-Centric Pre-training Paradigm for Autonomous Driving"},"reference_resolution":{"displayed":54,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":19,"verified_exact":2,"verified_fuzzy":33},"total_outbound_references":54},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 54 of 54 outbound references and 1 inbound Pith citation observation for arXiv:2411.14716."}