{"as_of":"2026-08-19T05:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:71c2257b4eeab8baef86a542bd2edd8d6557d3ffeedfe20db02868cc0c2a3c06","coverage":[{"denominator":88,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":88,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:29:04.998023Z","state":"measured"},{"denominator":88,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":88,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.12709/citation-record","integrity":"/paper/2504.12709/integrity","json":"/paper/2504.12709/citation-record.json","paper":"/paper/2504.12709"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-16T12:29:04.449609Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.449609Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:c2c58177dfd1899ae2963c8a60593ca8bdecb1671a7e773a2f2c7e8ae7aca4ca","observation_id":"e72e2a1e-c9e3-4114-8066-9b2e0fb63bd4","resolution":{"observed_at":"2026-08-16T12:29:04.449609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.455259Z","title":"Transfusion: Ro- bust lidar-camera fusion for 3d object detection with trans- formers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.455259Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:b095841e5b0c91df2db6416577990a4c8dbb73a6c7486dfd6dc31a4a8beb216a","observation_id":"d66fcc00-127b-4914-8c64-4c9edd6da90a","resolution":{"observed_at":"2026-08-16T12:29:04.455259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.460448Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.460448Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:fe07680f10f315b902edd8584ff6c1dfc01bb8c5d0fa99baf159668abf255086","observation_id":"63b4f935-7f43-4d97-a21d-8636b7f5ac9e","resolution":{"observed_at":"2026-08-16T12:29:04.460448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.465599Z","title":"Nuplan: A closed-loop ml-based plan- ning benchmark for autonomous vehicles, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.465599Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:28932471f6827229b0edd1b7740444d6841d2d76571382e7d52b03593e05f144","observation_id":"4d0d5267-deb9-42d4-b02b-d7054dc782d0","resolution":{"observed_at":"2026-08-16T12:29:04.465599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.470630Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.470630Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:83532959b7a705470c8f7af4b0dc256b9f6a426843a3bfc4fd16f6edb15a7119","observation_id":"07e58b06-8d32-41f8-8cd1-f897bee6c9ce","resolution":{"observed_at":"2026-08-16T12:29:04.470630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.476510Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.476510Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:74a5a12c74ad73f78d88814e05b209a1f67681caec7d4db47526adb9ab1c8378","observation_id":"c72d8efa-0a94-4c10-84fd-9b4d62fd71a8","resolution":{"observed_at":"2026-08-16T12:29:04.476510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.481756Z","title":"Multi-view 3d object detection network for autonomous driving","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.481756Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:d6bba3d09a2524b07d20db065b11221c53c19ebe3d8450d4824b5b627a39f7f5","observation_id":"f7d1ff38-0f05-4940-9f3f-e48aa94a35b0","resolution":{"observed_at":"2026-08-16T12:29:04.481756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-16T12:29:04.487054Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.487054Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:bd005279150ef3412fdc37ba79de238f02029e2df959f1d2efbf6b519199a4e8","observation_id":"607f9cf9-42a5-46a3-a452-eb8cb80a8206","resolution":{"observed_at":"2026-08-16T12:29:04.487054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09386","last_updated":"2022-11-17T07:26:14Z","snapshot_observed_at":"2026-08-18T03:04:56.022314Z","submitted_at":"2022-11-17T07:26:14Z","title":"BEVDistill: Cross-Modal BEV Distillation for Multi-View 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09386","snapshot_observed_at":"2026-08-16T12:29:04.492171Z","title":"Bevdistill: Cross-modal bev distillation for multi-view 3d object detection.arXiv preprint arXiv:2211.09386, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.492171Z"},"links":{"cited_paper":"/paper/2211.09386","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:53205863cd5118439632a7afb59b40323d5b46b19296fc7da73af0852b5f7880","observation_id":"b6a1d6a7-bf0b-4690-8610-700ad7391b4e","resolution":{"observed_at":"2026-08-16T12:29:04.492171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.497205Z","title":"Back-tracing representative points for voting- based 3d object detection in point clouds","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.497205Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:95661be13cafc7efee3fb65bafb74e2dd348107d2dd9f22660116e7f3d3e5e70","observation_id":"d2ed17b4-7f48-4004-9557-5f5304daa1e9","resolution":{"observed_at":"2026-08-16T12:29:04.497205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.501994Z","title":"Lyft 3d object detection for autonomous vehicles","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.501994Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:82bd771e856ad8798997c8c77e0879c238f2c57160227ec2d5aaf172fab5d4f9","observation_id":"d0c19000-001c-4c47-89e8-26aa6b069643","resolution":{"observed_at":"2026-08-16T12:29:04.501994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.506366Z","title":"Scaling vision transformers to 22 billion pa- rameters","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.506366Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:4a1aca921cfab13f30e26ed2a7bc1f783d6e0c81d8732d5a9a1d860c87f51f80","observation_id":"5218d50f-fe7a-4ec5-a78c-08f5947374c8","resolution":{"observed_at":"2026-08-16T12:29:04.506366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.328051Z","title":"V oxel r-cnn: To- wards high performance voxel-based 3d object detec- tion","venue":null,"work_id":"2f8bd60d-393c-48b6-8742-28ebe267d0cd","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.511138Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:8e8d7cf9f4c9627b1bc518f50b27d80e88fea417300d1d7241a3a9721b92b266","observation_id":"92757011-8770-453a-9af1-5733e097c343","resolution":{"observed_at":"2026-08-16T12:29:06.333426Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.515500Z","title":"Embracing single stride 3d object detector with sparse trans- former","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.515500Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:1dba3b56cae950ff861f42fca4faa73d57c91b61e6700766c175d96a1bca126a","observation_id":"b0fd37f0-c2e6-45b8-95b2-72c1116ad499","resolution":{"observed_at":"2026-08-16T12:29:04.515500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.302562Z","title":"Sparse dense fusion for 3d object detection","venue":null,"work_id":"daba45f4-4809-478e-b31a-202703f2f17d","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.520656Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:3ad89c15334feb9d06019c272d5a088197c4a93f23ac2e282c83a9338566ed18","observation_id":"a680525e-cc87-4285-b76a-bb8b4c30ed88","resolution":{"observed_at":"2026-08-16T12:29:06.307496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.287194Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":"c9593b4c-2f82-45dd-a5a7-30436fd582e0","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.525685Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:3cbd7ffa44ba1b7e21d3ec52fd19f7dc9da471d2d15716bf242b9153cceb592f","observation_id":"98a104f9-f67f-4936-ab26-be96a0c0fb96","resolution":{"observed_at":"2026-08-16T12:29:06.292320Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.272115Z","title":"Masked autoencoders are scalable vision learners, 2021","venue":null,"work_id":"58797048-4c8d-44e4-b85a-9e40d17b3c13","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.530641Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:aa46199731e654db6926a5059e1e432dc283f0bf391ea0293ad00721c6a3aa36","observation_id":"66d0ca62-ca8f-416a-bac3-2370bec36515","resolution":{"observed_at":"2026-08-16T12:29:06.276923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.257474Z","title":"Data-efficient image recognition with con- trastive predictive coding","venue":null,"work_id":"51393511-7510-4d95-87f3-3d9175601c1b","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.535260Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:0f45b04e6cd5a6e750cae882b312df0b31676df521f94636d7869dbefb9fa13f","observation_id":"089bfaa8-7625-40f0-8fe2-7b840912a737","resolution":{"observed_at":"2026-08-16T12:29:06.262228Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.242276Z","title":"Masked autoencoder for self-supervised pre-training on lidar point clouds","venue":null,"work_id":"7d6aab00-505a-45f4-8c2a-15a3e5acf8f4","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.540202Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:1c4899755ee6248317c944374d5afc89aa321c952dcb92ff04f1a31451e209e1","observation_id":"73d38042-0a3f-4c3f-a310-8657655e4257","resolution":{"observed_at":"2026-08-16T12:29:06.247260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-08-17T05:15:58.663240Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-16T12:29:04.544790Z","title":"Bevdet: High-performance multi-camera 3d object de- tection in bird-eye-view","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.544790Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:0bd42c99c067d69ba11625fbbb707523013e691ec6d492e4179eb18a5085b2e1","observation_id":"6f9926f3-f595-4ed4-a807-149d362b0cb7","resolution":{"observed_at":"2026-08-16T12:29:04.544790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.224237Z","title":"Ep- net: Enhancing point features with image semantics for 3d object detection","venue":null,"work_id":"060d9df4-f851-4dd1-8edd-78d17117b28c","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.550010Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:fc3592edd107b4db3b7351f38dfd091c80d91899332151c1072fcb695f602dac","observation_id":"d9eaeec5-7be3-472c-9334-e772ad785941","resolution":{"observed_at":"2026-08-16T12:29:06.229691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.204330Z","title":"Tri-perspective view for vision- based 3d semantic occupancy prediction","venue":null,"work_id":"7f9d68c5-f8c7-436e-a756-e1c7d24f59b4","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.555109Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:65ac7ea82acb7fa706a5f51e5674d3577ce0ee9d71aa2c9baec58477c747ab2a","observation_id":"7fd0c8c0-7fc3-4343-8305-72f792b8985a","resolution":{"observed_at":"2026-08-16T12:29:06.210127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.185414Z","title":"Learning semantic segmentation from multiple datasets with label shifts","venue":null,"work_id":"cc31e078-f873-4efa-ae08-21f3e3f6726f","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.559702Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:3d54d3c8aeca70a084abc6d5156919427f20ad91228fca2547fe02db72fbfbb3","observation_id":"97b86348-507e-4bb5-80a9-61c8353fcab0","resolution":{"observed_at":"2026-08-16T12:29:06.192703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09859","last_updated":"2025-03-11T02:14:51Z","snapshot_observed_at":"2026-08-18T03:04:53.144096Z","submitted_at":"2024-08-19T10:07:00Z","title":"OccMamba: Semantic Occupancy Prediction with State Space Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09859","snapshot_observed_at":"2026-08-16T12:29:04.564292Z","title":"Occmamba: Semantic occupancy prediction with state space models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.564292Z"},"links":{"cited_paper":"/paper/2408.09859","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:c6516a38b8d522a5e145525413e9668e4c33a4be585dd61a5ef3c7a8ef8d850b","observation_id":"71585212-1172-44f1-acdd-260fce955433","resolution":{"observed_at":"2026-08-16T12:29:04.564292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.166438Z","title":"Deepfusion: Lidar-camera deep fusion for multi-modal 3d object detection","venue":null,"work_id":"81be5199-416d-4b3e-96e1-dc402a5dfb5c","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.569341Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:2f6ed47dcaa8363a3bf89c672ef126d9439bfb5c0c10ce416fe3536d2ec37e19","observation_id":"ec34b3f8-a8a7-49d0-bc9c-a944839062a6","resolution":{"observed_at":"2026-08-16T12:29:06.172644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.147120Z","title":"Simipu: Simple 2d image and 3d point cloud un- supervised pre-training for spatial-aware visual representa- tions","venue":null,"work_id":"1f7a727c-5d57-44c4-ad05-47dedfc8e454","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.573629Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:8b2741d57711cb61786eb8f9d354bf5d451cf9b1668c3ccbbd5f5b22d4d74dc4","observation_id":"65131e67-1e96-450d-8aa8-8904315e788b","resolution":{"observed_at":"2026-08-16T12:29:06.152448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.131232Z","title":"Bev- former: Learning bird’s-eye-view representation from multi- camera images via spatiotemporal transformers","venue":null,"work_id":"0fdaa631-6b60-46a4-b7c0-0fba53ae68bb","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.696083Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:0e64ef4d982dac9a94be7675a2a11792fff35060d0afa22c48d17fc5ba8d3a28","observation_id":"b4e4d9f2-a8d4-4bf5-b411-d50e69850c26","resolution":{"observed_at":"2026-08-16T12:29:06.136244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.114597Z","title":"Bevfusion: A simple and robust lidar-camera fu- sion framework","venue":null,"work_id":"3dab6983-cacd-4e26-a1cf-dd04e5057997","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.700912Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:c272a47f1d8458bbcf601376caef19eea6f1f94f338010d95376ea69d63e30f3","observation_id":"0a9ca2cf-a20f-4435-9e2d-2699ae2da981","resolution":{"observed_at":"2026-08-16T12:29:06.119937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.097591Z","title":"Geomim: Towards better 3d knowledge transfer via masked image modeling for multi-view 3d un- derstanding","venue":null,"work_id":"09364c44-5717-4435-a0c7-026ed10aba26","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.705414Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:4c820af55ff1bca6275b120d4464fc26f737c3c011d9bd6e5da1f893fadfc88a","observation_id":"28fca571-aead-4149-bba9-21e4922bc6ec","resolution":{"observed_at":"2026-08-16T12:29:06.103232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.13089","last_updated":"2020-12-24T04:00:52Z","snapshot_observed_at":"2026-08-18T03:04:59.106980Z","submitted_at":"2020-12-24T04:00:52Z","title":"P4Contrast: Contrastive Learning with Pairs of Point-Pixel Pairs for RGB-D Scene Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.13089","snapshot_observed_at":"2026-08-16T12:29:04.709889Z","title":"P4contrast: Contrastive learn- ing with pairs of point-pixel pairs for rgb-d scene understand- ing","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.709889Z"},"links":{"cited_paper":"/paper/2012.13089","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:20622fc647fc54198f94cb81a77fddfcab55a27f8e14bf70f6074cfc312a65e0","observation_id":"0fc43de0-54a0-4fc7-b8ba-4f6b99ac018a","resolution":{"observed_at":"2026-08-16T12:29:04.709889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.078124Z","title":"Petr: Position embedding transformation for multi-view 3d object detection","venue":null,"work_id":"c2785421-7832-4a14-85f9-e3ec322294be","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.715081Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:02de61fbaa338a8b6be493e70f6eeab45d78996b1661e44bd53efbad186a303b","observation_id":"fe8faa54-45f3-4beb-81ee-2ef73f05460d","resolution":{"observed_at":"2026-08-16T12:29:06.083322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.720385Z","title":"Swin trans- former: Hierarchical vision transformer using shifted win- dows, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.720385Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:9b84b651283141343dde638a1d7fbea7f8d8a3fedc192abde0eb966a6200b058","observation_id":"46289bd7-e323-4e71-a664-46562fdec579","resolution":{"observed_at":"2026-08-16T12:29:04.720385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.050820Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"479134b4-68cb-4364-949c-74455cbe7fd2","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.725189Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:41e60ad3eb4e06a6f9e4d0de519709344317058d0b518ab9ad7f4e6624c1f012","observation_id":"82dc1b25-46a9-4e80-908c-86673467a312","resolution":{"observed_at":"2026-08-16T12:29:06.055953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11037","last_updated":"2021-10-25T08:08:25Z","snapshot_observed_at":"2026-08-16T18:15:40.632496Z","submitted_at":"2021-06-21T12:28:08Z","title":"One Million Scenes for Autonomous Driving: ONCE Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11037","snapshot_observed_at":"2026-08-16T12:29:04.730095Z","title":"One million scenes for autonomous driving: Once dataset","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.730095Z"},"links":{"cited_paper":"/paper/2106.11037","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:933d6da14aedfb91f9310ace09dc6a732be423674b8ac9a6019ae6cef6512fa1","observation_id":"de6c53ea-46f2-45c9-b663-ca8702143c84","resolution":{"observed_at":"2026-08-16T12:29:04.730095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.032673Z","title":"V oxel transformer for 3d object detection","venue":null,"work_id":"e3ddcd44-9988-4b0a-98ec-2ba0dc44b4fc","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.735732Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:7cfc9c60d6011edc1d400841996c2b7a020b5a06e01ef4cad9011805df73d004","observation_id":"8e771814-ec7a-49f8-a268-5fe4ee774820","resolution":{"observed_at":"2026-08-16T12:29:06.037906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:06.015677Z","title":"Multi-camera unified pre-training via 3d scene recon- struction","venue":null,"work_id":"b8e9c8a9-0aff-4a46-9bf0-c268b6feebec","year":2024},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.740615Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:e59fd20f0da81a3b9a7f67c5f51a273480a9c610452379bb68372de986073397","observation_id":"a2acd7c4-c104-4838-a26a-348a22eea51c","resolution":{"observed_at":"2026-08-16T12:29:06.020710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.996116Z","title":"Uniscene: Multi-camera unified pre-training via 3d scene reconstruction for autonomous driving, 2024","venue":null,"work_id":"66aa2c94-836e-41a6-9958-7ab95e03a0bb","year":2024},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.746036Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:9dd97c254d319552529de55cf2dad23db8ad16aaf92866b8fb291bcef97cad49","observation_id":"382dff7f-c24b-4d35-bf0f-3a5c349e3da2","resolution":{"observed_at":"2026-08-16T12:29:06.003658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.980547Z","title":"Self-supervised learning of pretext-invariant representations","venue":null,"work_id":"004681d7-c67f-4279-b034-48fa76e30210","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.750966Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:588b901bbb56bf49871bcfb006ffeb7c6a5745bf094f97aa90b854d9ffc245c0","observation_id":"b3a4e140-91d8-41d1-8c22-e8b7066e602e","resolution":{"observed_at":"2026-08-16T12:29:05.985516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.963584Z","title":"Masked autoencoders for point cloud self-supervised learning","venue":null,"work_id":"17347410-20d3-4a6b-bfb6-eb43d8f89eae","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.756015Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:7bc9c54efa6b0933376bdc5373fddb58a2af790713e9bf1f2f56f25cdbf3c0c1","observation_id":"a17bb197-64d9-4fa7-92fd-d4802ecd0248","resolution":{"observed_at":"2026-08-16T12:29:05.969142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.947155Z","title":"Simpletrack: Understanding and rethinking 3d multi-object tracking","venue":null,"work_id":"f8e1bb49-aad7-4147-a575-7b43dfdfa2ba","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.760693Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:f44c5a16e07a9c9e0b82a8c39e2c10dc8ba285934f2fe73da80a8f4c9a2f376a","observation_id":"8d4b43a7-29c5-46a6-8169-1568233ce3da","resolution":{"observed_at":"2026-08-16T12:29:05.952969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.929845Z","title":"Standing between past and future: Spatio-temporal modeling for multi-camera 3d multi- object tracking","venue":null,"work_id":"01be60ce-dc14-4add-879b-bcec6f73e11d","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.765204Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:696213fe778cc047f13c3c0b855265d4501d2b6b1ae530f6bb06d0fe5955204a","observation_id":"b089837e-43fb-49fa-a2a7-b3171c396649","resolution":{"observed_at":"2026-08-16T12:29:05.935375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.00729","last_updated":"2023-05-01T09:12:30Z","snapshot_observed_at":"2026-08-16T15:36:34.181469Z","submitted_at":"2023-05-01T09:12:30Z","title":"What Do Self-Supervised Vision Transformers Learn?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.00729","snapshot_observed_at":"2026-08-16T12:29:04.769709Z","title":"What do self-supervised vision transform- ers learn? arXiv preprint arXiv:2305.00729, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.769709Z"},"links":{"cited_paper":"/paper/2305.00729","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:72e819c97d9cce4e9db7dd78c793252c1d627cf4c6e817d6d3fd48563a8cfd7a","observation_id":"a58a8716-1fab-4a4d-90eb-31829caef806","resolution":{"observed_at":"2026-08-16T12:29:04.769709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.913720Z","title":"Lift, splat, shoot: En- coding images from arbitrary camera rigs by implicitly un- projecting to 3d","venue":null,"work_id":"5925d2c5-0d89-463c-b015-e791bb7a0f74","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.774663Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:2983d19430d23a5b4cc7944987fd852d20d9d4387087c758ca82a7a31cf907d0","observation_id":"22d1af9b-6df6-4419-a516-9cb00d7e5871","resolution":{"observed_at":"2026-08-16T12:29:05.918876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.896044Z","title":"Deep hough voting for 3d object detection in point clouds","venue":null,"work_id":"06649c8d-8a71-4658-ac6f-7f57b8722215","year":2019},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.779336Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:094a1ebcdb918922f49ff1279bffdc27d0686444f94da8176178dccc369e4c36","observation_id":"bd90abcb-f341-43ca-8e03-8a06373428f1","resolution":{"observed_at":"2026-08-16T12:29:05.901850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.878201Z","title":"Learning transferable visual models from natural language supervision, 2021","venue":null,"work_id":"c5c1305f-4411-47ee-9095-7990de894f15","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.783829Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:b7084052881206d85081c5a90e21700c16f70de370727bdffe097a9b71f1dc47","observation_id":"12d9a611-b081-4544-b5a0-2dbb6954f258","resolution":{"observed_at":"2026-08-16T12:29:05.883422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.862355Z","title":"Image-to-lidar self-supervised distillation for autonomous driving data,","venue":null,"work_id":"83f3e363-60ff-4e66-a2a1-9e2cc7911f5a","year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.788501Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:e5a76986107f73b3cf8e8448ea1ab7e4178642e132822755f2507401bfd8136c","observation_id":"067ba32f-7414-46fa-a9d4-3e7961cf9b8d","resolution":{"observed_at":"2026-08-16T12:29:05.867407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.793465Z","title":"Pointr- cnn: 3d object proposal generation and detection from point cloud","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.793465Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:b7e86d5178b3be86547e8a71039f38cc0928068822a949ef80cd739e7d41a8cb","observation_id":"441789eb-f4c8-4084-9466-02b10e4434ce","resolution":{"observed_at":"2026-08-16T12:29:04.793465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.835661Z","title":"Pv-rcnn: Point-voxel feature set abstraction for 3d object detection","venue":null,"work_id":"32845ec4-aa7d-488f-a33b-38cfb3a3ebae","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.798848Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:77f66d7c49efa0baf066e0b08a8aeddc270d533eca167ca415e66d2fd9aeecd0","observation_id":"bc8433c6-2d9a-466a-901e-e83bb8d9437d","resolution":{"observed_at":"2026-08-16T12:29:05.840845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.818809Z","title":"From points to parts: 3d object detec- tion from point cloud with part-aware and part-aggregation network","venue":null,"work_id":"ff79ddfd-cfb5-4077-9664-6e2a91cdb204","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.803561Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:ba83e035e30f00c27289bab6eaac76d99bb89bf9fc1213b76b51a022583b001d","observation_id":"711ba46e-d296-4241-895d-c68d1081852f","resolution":{"observed_at":"2026-08-16T12:29:05.824006Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.802689Z","title":"Mvx- net: Multimodal voxelnet for 3d object detection","venue":null,"work_id":"e5b7e624-2ef2-4b39-aa5a-aa1468a5060f","year":2019},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.807789Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:f09e53b0014639b00b2c76564c82f531ec28b2c5531b10d39d8dcc3afca7f1cf","observation_id":"759d9ceb-e6c0-44f1-a6e2-4e4c2f273872","resolution":{"observed_at":"2026-08-16T12:29:05.808012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00349","last_updated":"2023-11-27T14:42:52Z","snapshot_observed_at":"2026-08-19T04:15:22.961077Z","submitted_at":"2023-06-01T05:06:56Z","title":"CALICO: Self-Supervised Camera-LiDAR Contrastive Pre-training for BEV Perception","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00349","snapshot_observed_at":"2026-08-16T12:29:04.812438Z","title":"Calico: Self- supervised camera-lidar contrastive pre-training for bev per- ception","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.812438Z"},"links":{"cited_paper":"/paper/2306.00349","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:27b8e24534db19a977a4d49ef76db191100899eecb98cd8423db1c9c53176974","observation_id":"e0bd6fcd-9720-42f1-96b4-cec0a5d0e4d8","resolution":{"observed_at":"2026-08-16T12:29:04.812438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.786630Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":"757b67b0-b17d-4a10-b2fa-989c3e80486c","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.817238Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:ad7dd8f67397ab8043b0b057ddfe2cdfc7356b1353167cce147b7d3c302cc091","observation_id":"c774d46b-34e7-42cb-a9b4-ac89e00497aa","resolution":{"observed_at":"2026-08-16T12:29:05.791952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-16T12:29:04.821696Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.821696Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:214c31193f16f704ae3557778928ab3e491408b54f4cd986d9c5b25aa2713344","observation_id":"53296ce4-7430-4028-99b0-6954e4a48747","resolution":{"observed_at":"2026-08-16T12:29:04.821696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.826720Z","title":"Pointpainting: Sequential fusion for 3d object de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.826720Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:9e280bcbbdc56674c1dfea4e2cce81b39630175d7440ba9b34fa5d28a42da08d","observation_id":"9013c791-794b-4faa-a182-5b20bf3d9467","resolution":{"observed_at":"2026-08-16T12:29:04.826720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.761299Z","title":"Pointaugmenting: Cross-modal augmentation for 3d object detection","venue":null,"work_id":"9ec72c52-5a3b-4a05-9b5f-fe83be5b6a03","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.831294Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:db468c4aac9cca3370438fd32b781cb3db84a4c65fb663cc6f6eca3e651887a5","observation_id":"7e97f82f-3563-41fd-b699-934a97a97fec","resolution":{"observed_at":"2026-08-16T12:29:05.766198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.745221Z","title":"Rbgnet: Ray-based grouping for 3d object detection","venue":null,"work_id":"ae9ca553-ef46-4dae-8013-5135bb966d7d","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.835839Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:1674e2649cf38004480bbb3a639f1b2f346f69583253be87e387e3df067574f0","observation_id":"6a35e5f2-8da3-4e26-b80b-d5ba1351f7cb","resolution":{"observed_at":"2026-08-16T12:29:05.750442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.730727Z","title":"Dsvt: Dy- namic sparse voxel transformer with rotated sets, 2023","venue":null,"work_id":"b1c37538-27cc-4ed4-b15e-c9a015d2fdfd","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.840626Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:5428a5803cd8c957b5549a43d132eae15ef64a79a32ad6dbb0b029525a7a7afd","observation_id":"f2524166-d622-4b6a-af02-e075a62f82fa","resolution":{"observed_at":"2026-08-16T12:29:05.735440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.715841Z","title":"Unitr: A unified and efficient multi-modal transformer for bird’s-eye-view repre- sentation","venue":null,"work_id":"3f055c3f-4499-4586-832d-42d01be6ba19","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.845494Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:390c2f0a22c7553a402bfb9ab8d5f464a67de107a725302fe826fd8a14fd1b8d","observation_id":"2d4dbffb-8fbe-4a31-a2d8-ad18531ee729","resolution":{"observed_at":"2026-08-16T12:29:05.720762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.699376Z","title":"Cross-dataset collaborative learning for seman- tic segmentation in autonomous driving","venue":null,"work_id":"524de809-a852-49ad-85dc-4729543c6882","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.850433Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:6e5e1e9143569edaf0e270fd0917ae0e2ecb84efd04328ee9f51c0b009c4e6f8","observation_id":"007d9845-ff13-4cfa-b028-321adec6f841","resolution":{"observed_at":"2026-08-16T12:29:05.704281Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.681431Z","title":"Mv- contrast: Unsupervised pretraining for multi-view 3d object recognition","venue":null,"work_id":"fcdbf609-02f2-4476-bf92-b6d5244c6851","year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.854929Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:2bd10fda17965ee4501436d8b1a394d191f98353c3795f7c28084ed003d471d6","observation_id":"16d8a9ce-5bd2-4f14-816d-73aa3931097d","resolution":{"observed_at":"2026-08-16T12:29:05.687952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.664125Z","title":"Tracking everything everywhere all at once","venue":null,"work_id":"27a407e9-b581-44a2-988d-1aa9bd5094fe","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.859569Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:76e978db07ec113925d353499ed8e179e86f74566defa72831dd614932ebbc05","observation_id":"795e196f-bedf-441e-8bf3-6abc2b608bdf","resolution":{"observed_at":"2026-08-16T12:29:05.669575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.644882Z","title":"Fcos3d: Fully convolutional one-stage monocular 3d object detection","venue":null,"work_id":"5fbeedda-0ca2-4be1-a948-f20e43bdf463","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.864755Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:0c223994be63ed1270982c2397644f897f09754f5cba98eb5d07ad503cb01cda","observation_id":"e6942a76-e74d-4def-a3ed-e016705bbd7d","resolution":{"observed_at":"2026-08-16T12:29:05.651697Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.623111Z","title":"Openoccupancy: A large scale benchmark for surrounding semantic occupancy perception","venue":null,"work_id":"7adae00b-6b8b-4ede-af2a-038403ce684a","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.869666Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:ceabac84d20f03061f0b8f7142e45cf99ff5c86e7557d93bbae6913320a7d4a3","observation_id":"815aa0ba-092b-4f3a-abc7-051cfe9ceefa","resolution":{"observed_at":"2026-08-16T12:29:05.630559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.603833Z","title":"Detr3d: 3d object detection from multi-view images via 3d-to-2d queries","venue":null,"work_id":"0bbf8735-480f-45a0-ada3-7757918450f7","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.875066Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:3c5991907ec0fbc5279f8e754580faea32ee7eb1bc9f11db0fd5afc53b7fd8e5","observation_id":"2e1e4659-1248-4419-b092-7480dd02e2fb","resolution":{"observed_at":"2026-08-16T12:29:05.609928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.583825Z","title":"Masked feature predic- tion for self-supervised visual pre-training","venue":null,"work_id":"cf16f4fe-891c-48d5-babe-969af0e4dbfc","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.879815Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:4c4a55ad004124225b47e74842b784ce2ea57dd9c13eab0379ebeccf3cab93fd","observation_id":"93aaf10b-9847-40ba-ad20-e5dcc37610dc","resolution":{"observed_at":"2026-08-16T12:29:05.589009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.566356Z","title":"Virtual sparse convolution for multimodal 3d ob- ject detection","venue":null,"work_id":"4a2ee0a6-960a-42de-a5f9-b3875ff19bca","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.884523Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:247eb5059f3b2b313de6773058f6eef6e758eb5144443f4cfaa60aa167b19c44","observation_id":"c53a3cda-4791-4f94-8b56-9554a4035a2a","resolution":{"observed_at":"2026-08-16T12:29:05.571702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.548468Z","title":"Towards large-scale 3d representation learning with multi-dataset point prompt training","venue":null,"work_id":"5af9dd3c-e608-489f-a49f-20cd4a7c148c","year":2024},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.890415Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:1c2e99cab643e368c55ba9869101718a2e66ea86fce9d6fcdbad54f9bc4d3f89","observation_id":"7bd373c8-3107-4676-a4a4-f7d5f3890473","resolution":{"observed_at":"2026-08-16T12:29:05.554412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05088","last_updated":"2022-04-19T05:40:19Z","snapshot_observed_at":"2026-08-16T17:07:47.661183Z","submitted_at":"2022-04-11T13:43:25Z","title":"M$^2$BEV: Multi-Camera Joint 3D Detection and Segmentation with Unified Birds-Eye View Representation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05088","snapshot_observed_at":"2026-08-16T12:29:04.895032Z","title":"M2 bev: Multi-camera joint 3d detection and segmentation with unified birds-eye view representation","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.895032Z"},"links":{"cited_paper":"/paper/2204.05088","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:7c6c808d1730038976081c846761c5c124e392ee697b3230e0a2e1423e78c17f","observation_id":"faa3470d-ce8e-44c9-ae3c-ae33d20e704e","resolution":{"observed_at":"2026-08-16T12:29:04.895032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.531929Z","title":"Pointcontrast: Unsupervised pre- 11 training for 3d point cloud understanding","venue":null,"work_id":"81dd7c67-8fe4-4f4f-873d-3dac99734738","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.899905Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:74b1110ad80528de183cd41b8303bdda661438b0dc8df18b06802b199fce7d09","observation_id":"1c8a4479-cd35-4eac-b096-376af9139f9f","resolution":{"observed_at":"2026-08-16T12:29:05.537360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.514636Z","title":"Qi, Leonidas J","venue":null,"work_id":"8ef5ee71-dff7-4d4a-97a6-4f0602c721be","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.904654Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:f08087a919a62133a88b354980dffde5a1503325d1374093ee298262e79009c6","observation_id":"1d3b27e7-539a-42f5-af28-bcbac3e648d8","resolution":{"observed_at":"2026-08-16T12:29:05.520405Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.497866Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"a6bf9ad3-2870-4332-9d26-28a07597f45c","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.909297Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:400615f6b295113c1875db13b497c9b4ec2e3ccb7f8b002250c030be1f4ffdfb","observation_id":"9568c564-2863-49ec-9f9c-f74133bfdaef","resolution":{"observed_at":"2026-08-16T12:29:05.503265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.479454Z","title":"Cross modal trans- former: Towards fast and robust 3d object detection","venue":null,"work_id":"3986b6a9-a608-4eaf-b27a-105e08d64bbd","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.914256Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:f1f21f95e7ea7f2e2ac703a5ce949a3ab9c54783a5d702ac0a1c2bc2af8a11da","observation_id":"0158ed4e-f3c0-4d85-bd18-25eb96396fa4","resolution":{"observed_at":"2026-08-16T12:29:05.484923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10527","last_updated":"2025-07-16T08:17:09Z","snapshot_observed_at":"2026-08-18T03:05:06.448219Z","submitted_at":"2023-09-19T11:13:01Z","title":"SPOT: Scalable 3D Pre-training via Occupancy Prediction for Learning Transferable 3D Representations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10527","snapshot_observed_at":"2026-08-16T12:29:04.918936Z","title":"Spot: Scalable 3d pre-training via occu- pancy prediction for autonomous driving","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.918936Z"},"links":{"cited_paper":"/paper/2309.10527","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:655b9d3f1a3ad522b2db4f900b2c2c008cf629ba6106487d1621650b542f907e","observation_id":"e8a26a85-bb4c-4141-9708-ec40c172cd99","resolution":{"observed_at":"2026-08-16T12:29:04.918936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.464438Z","title":"Second: Sparsely embed- ded convolutional detection","venue":null,"work_id":"2195cb0f-ece9-4e75-ac63-d5dcf6b2b8ae","year":2018},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.923624Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:a7ff6a852ad65c80c2aec86269151cfe7f0ff1a7f034287c3be27fee30fb644b","observation_id":"e66dd811-29ac-4201-9bd2-437a68ce9aae","resolution":{"observed_at":"2026-08-16T12:29:05.469494Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.10589","last_updated":"2022-07-21T16:32:05Z","snapshot_observed_at":"2026-08-18T10:29:34.736567Z","submitted_at":"2022-07-21T16:32:05Z","title":"Boosting 3D Object Detection via Object-Focused Image Fusion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.10589","snapshot_observed_at":"2026-08-16T12:29:04.929624Z","title":"Boost- ing 3d object detection via object-focused image fusion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.929624Z"},"links":{"cited_paper":"/paper/2207.10589","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:fd8003e2479502836a8fbeb307ca4c365412b4fc985b1c7519fd9ff46aad7f19","observation_id":"c5cddb47-7c53-4fce-89f6-2b76cab1f634","resolution":{"observed_at":"2026-08-16T12:29:04.929624Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.448423Z","title":"Gd-mae: Gen- erative decoder for mae pre-training on lidar point clouds,","venue":null,"work_id":"5c7af333-24b0-45eb-97bc-8173ff35969a","year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.935221Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:e62129180a7be8eefb592cb361fd0e4e3f651a0d52262c86c95982c6d678c515","observation_id":"8bae362b-5d29-441d-972b-3ce993682baf","resolution":{"observed_at":"2026-08-16T12:29:05.453699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.431335Z","title":"Pred: pre-training via semantic rendering on lidar point clouds","venue":null,"work_id":"c8323668-b51d-4078-aa1d-dba114691a28","year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.941512Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:749e6959706283175421e01145cc691f685897fb784951a52a2c5f6c50ca8782","observation_id":"13aefb75-e5ab-4689-9634-7608ad071a3a","resolution":{"observed_at":"2026-08-16T12:29:05.436633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.414230Z","title":"3dssd: Point-based 3d single stage object detector","venue":null,"work_id":"10bc872e-2869-4275-839b-b8e3ebd1bc3d","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.946603Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:a77587bfa5de536736115a6c991a8d087383e705236c3ef1a3c8b9756806f572","observation_id":"27384206-382a-4dfe-9272-eb97fc8ee122","resolution":{"observed_at":"2026-08-16T12:29:05.419325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.397705Z","title":"Center- based 3d object detection and tracking","venue":null,"work_id":"ce2f8c51-e62f-4418-bd16-8ebfd749a9cc","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.952697Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:727def48905483e6cfb7e167267a521e0c5172d64d23a11b33e99760535a3338","observation_id":"74519015-6f4d-48fc-b2c5-18df8ee25ba6","resolution":{"observed_at":"2026-08-16T12:29:05.403184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.379814Z","title":"3d-cvf: Generating joint camera and lidar fea- tures using cross-view spatial feature fusion for 3d ob- ject detection","venue":null,"work_id":"1cb4f744-1067-4e32-b27f-7b2eebbf04d6","year":2020},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.958493Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:044db09d235bda5d7722d3870a4a6d643cf8ebe01b42cc82c4f590ba31f15839","observation_id":"f39a6e44-707e-43a2-89ef-9604fd80d027","resolution":{"observed_at":"2026-08-16T12:29:05.386205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07284","last_updated":"2024-07-10T05:20:23Z","snapshot_observed_at":"2026-08-18T03:04:23.607352Z","submitted_at":"2024-03-12T03:34:03Z","title":"SparseLIF: High-Performance Sparse LiDAR-Camera Fusion for 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07284","snapshot_observed_at":"2026-08-16T12:29:04.963199Z","title":"Sparselif: High-performance sparse lidar- camera fusion for 3d object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.963199Z"},"links":{"cited_paper":"/paper/2403.07284","citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:fbd407396c345774bfa5c32f50ca78481715e6fafbff24f27390887f0048590b","observation_id":"e9b68d7a-11af-47ae-8541-f2bd9cbdf0d8","resolution":{"observed_at":"2026-08-16T12:29:04.963199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.362879Z","title":"Point-m2ae: multi-scale masked autoencoders for hierarchical point cloud pre-training","venue":null,"work_id":"dc28e67c-6cc3-405a-98fb-9c2650afb853","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.968253Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:8e4f44ad57f0701d1ff432fd94ab5530826e52e16e2d961a1c9c04a8d0e05808","observation_id":"661e0502-73ce-4c45-a5e8-8c80045eeb71","resolution":{"observed_at":"2026-08-16T12:29:05.368023Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.346157Z","title":"Hvdistill: Transferring knowl- edge from images to point clouds via unsupervised hybrid- view distillation","venue":null,"work_id":"52402f5a-76ba-4318-bb48-258d19001ca3","year":2024},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.973466Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:3b0b79bbb18584ffd0e67731cff1274053f8946ee6d39eb43bf2115579d78d5d","observation_id":"d82f25d1-9b79-4b79-a14d-21f7a3d85aaf","resolution":{"observed_at":"2026-08-16T12:29:05.351182Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.330535Z","title":"Self-supervised pretraining of 3d features on any point-cloud","venue":null,"work_id":"873721fc-20d2-4f5b-8e74-d2e34afbaf24","year":2021},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.978031Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:09d83e44086c29cf8fdb01c33c03e215c821ebe2023611287c0faacabb47eaf7","observation_id":"499a02cd-1d0b-4ce9-85f6-5bf4882c3fe0","resolution":{"observed_at":"2026-08-16T12:29:05.335464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.314227Z","title":"Unidistill: A universal cross-modality knowl- edge distillation framework for 3d object detection in bird’s- eye view, 2023","venue":null,"work_id":"6e26613a-3877-4a90-9517-7edf8cbb418c","year":2023},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.982624Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:64ce9a381c4992e1c49f840f5f254ab374577154f1d5a74ec5a1b0476e526c09","observation_id":"0ff301f7-a203-4bae-a331-d710e3274e89","resolution":{"observed_at":"2026-08-16T12:29:05.319944Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.296995Z","title":"Sim- ple multi-dataset detection","venue":null,"work_id":"b67e6736-40f2-4303-93a4-0e39d13773fc","year":2022},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.987292Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:87dd986f4f3135051cbead134722f871a3fa16bd11c4be9980a7c207a6578aee","observation_id":"931d9d47-bb01-4354-938e-3d9b8cae00f7","resolution":{"observed_at":"2026-08-16T12:29:05.302684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:04.992486Z","title":"Cylindrical and asymmetrical 3d convolution networks for lidar seg- mentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.992486Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:7f1ae1c8648ac00e6c5f455122928deb55e60319e80c4d40d57877eacb6a9141","observation_id":"621502f4-3981-4bbe-bba0-f7bbd8d943bf","resolution":{"observed_at":"2026-08-16T12:29:04.992486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:29:05.267142Z","title":"NuScenes","venue":null,"work_id":"6e9f2221-7919-4e6a-9f49-307dde547670","year":null},"citing_paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-16T12:29:04.998023Z"},"links":{"citing_paper":"/paper/2504.12709"},"observation_digest":"sha256:56dc58100c374c2100997b78fdb42a063c6e1a5efdab33ce76f7b4854c268be9","observation_id":"938485b7-09dd-447a-851d-1b49ebbb6fdf","resolution":{"observed_at":"2026-08-16T12:29:05.273987Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.12709","last_updated":"2025-04-17T07:26:11Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T03:04:24.681023Z","submitted_at":"2025-04-17T07:26:11Z","title":"Self-Supervised Pre-training with Combined Datasets for 3D Perception in Autonomous Driving"},"reference_resolution":{"displayed":88,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":60},"total_outbound_references":88},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 88 of 88 outbound references and 0 inbound Pith citation observations for arXiv:2504.12709."}