{"as_of":"2026-08-10T08:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:34af76d9d851baa983ad03c365d46022236c1096664cf813f9fee65887013330","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T17:41:06.399906Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.04541/citation-record","integrity":"/paper/2607.04541/integrity","json":"/paper/2607.04541/citation-record.json","paper":"/paper/2607.04541"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"nuscenes: A multi- modal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:928518ecf92703ec8b8623ed8b45aefbdc554f591a91749939b5406e0fda51a7","observation_id":"062fba49-2154-4252-83a3-581a32873d73","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Scalability in perception for autonomous driving: Waymo open dataset,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:5e857f6697645c002bb0088fe0a7bd50f8b3e19556b64e6e074e319a213db9bc","observation_id":"7ecf7c28-bd24-49b1-8165-d411f97e777a","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Planning-oriented autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:38a7b68335448914587b88890203a764f2fc58d085db870d20b5fd9eef48e65b","observation_id":"e751352a-7adf-40a6-8a8e-0edc9b70dfb5","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Multi-modal 3d object detection in autonomous driving: A survey and taxonomy,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:52533ac8b556a05f2fe2636f6051e6677b96d8ff733123b0aa711be6d74e4a97","observation_id":"1564b81e-4c0c-400d-9309-016e581a3306","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Deep learning-based perception systems for autonomous driving: A comprehensive survey,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:7ac7e57af1816a1cd26e37b9cb9f154fb334dd113e38ae00c136c0f5e78935aa","observation_id":"cb2a1b19-dbb0-4122-b56e-3ea5ffb96dc5","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Towards deep radar perception for autonomous driving: Datasets, methods, and challenges,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:dfcd6254a3ba43baec282e9ae4798c9247d69442e2cfd5590d897e4553fd0fb3","observation_id":"3e2c7ddb-e386-4aa1-a736-d739c4624cf5","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Crkd: Enhanced camera-radar object detection with cross-modality knowledge distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:e7233dc4dc696470ea3d9e4ed4917ebc1b1947920f35c4a578d1e4b8411d5e95","observation_id":"4af08331-9973-44cd-afc5-64b636825662","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Multi-modal 3d object detection in autonomous driving: a survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ed3afb3bdc927f53e2bf90a8cf35d619ece768b459e8d398ff90d846ca6784ed","observation_id":"fcf1dbb4-ef65-4bee-a573-a9f8fa714553","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Vision meets robotics: The kitti dataset,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:b582e97a8457f9c51155e44f538b16d8ac1874520f03349860fb193e6f6a6818","observation_id":"934cff3c-d8f9-4df0-9063-6e9481f8daee","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Unifying voxel-based representation with transformer for 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:c6f2b1c0272c67b33484bd926cad586ccf9c444d8e984c434c9a3be6d4e66daa","observation_id":"7fc45cef-bd46-4528-a107-612ff3885da5","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:5274646075238ae3ac66df3f81f3f57a96981573941a503350710dd57d4e168d","observation_id":"0a0b34e7-1b7f-4baa-877f-4f9515664ecf","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Futr3d: A unified sensor fusion framework for 3d detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ad6c6306cbd62d0df6fddadebbb8cb7854c3a4d5353cf010f473488c693a16c2","observation_id":"ac29c394-c801-4c6a-9e0d-fa7f5075a35d","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19872","last_updated":"2024-10-24T07:37:57Z","snapshot_observed_at":"2026-07-06T19:39:55.766423Z","submitted_at":"2024-10-24T07:37:57Z","title":"Radar and Camera Fusion for Object Detection and Tracking: A Comprehensive Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19872","snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Radar and camera fusion for object detection and tracking: A comprehensive survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"cited_paper":"/paper/2410.19872","citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:b566c24d094ff48a957d43d72bd0d9aaa0659466094f3e0a7d1bc77f4e4cd43e","observation_id":"e0d4e467-6f96-413a-8252-193e487885c0","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Centerfusion: Center-based radar and camera fusion for 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:81d590403b03e22b26078ae98cd2b9bfe11cfaac6b3a5f2958239d3153770bcd","observation_id":"cebbb4c0-49ea-43e3-b4e2-1bff689c94d5","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"BEV-Guided Multi-Modality Fusion for Driving Perception,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:4b9844b00a21d50d1724317eea1ac26e62c92abc728625697282d92435370013","observation_id":"91ed6553-2435-4bef-b91c-60a6528c5093","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Crn: Camera radar net for accurate, robust, efficient 3d perception,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ad4688978625984494e665f0ee77351a0f48c01ad064e3134b60d96deee1efc8","observation_id":"05fc51d7-13d8-450b-8862-2b020a608998","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Bevcar: Camera-radar fusion for bev map and object segmentation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:11000973ba13eee84b902c54128924c1894cbd3309c0792e0278e2c3faaed9d4","observation_id":"8eb52c3c-7d2f-4fa3-b1d9-d7514f081be3","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Licrocc: Teach radar for accurate semantic occupancy prediction using lidar and camera,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:901796344597337529396e357ad7bd0408fa7c914e5d15a7f5e74bf193c61a49","observation_id":"00c05714-2f14-47c4-ae52-4f2d43ce85ff","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ce9b409139a74ce0027336708c7edd83788739d44b32d34bf0d5eb97ab69911a","observation_id":"0800e28f-1b25-4abc-81db-b4d3728d8380","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:6d18f5ad90f3279af6c47344eaeac1baaef8d655cc5d317b45fe3fe643944ad2","observation_id":"304d7ce1-644c-4537-a69a-4da10459b167","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Gd-mae: generative decoder for mae pre-training on lidar point clouds,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:f4c0b297aa4ce8786ce2080d331ba10646d76a389fefaa55655aeb12255dc8ed","observation_id":"322f5d86-c684-4336-8869-f8b90eacf7b6","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Unipad: A universal pre-training paradigm for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:0108faf6191d70a50c3ca8adbb7c5ced2d7ad7228c7ce49170080735380e0403","observation_id":"bba2c985-3fbe-442e-9e91-0468e4c85a60","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Visual point cloud forecasting enables scalable autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:55fb434dad2ba0afba59ab089063a9dc5f58b13b8bd3a8b7f364444947f0c0ff","observation_id":"4d58cf56-2753-4e0f-baef-b3eb90f5f726","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Forging spatial intelligence: A roadmap of multi-modal data pre- training for autonomous systems,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:dd81a40189614693ea4033607cc604a14fda46cdbb1b1adf416bd290e239d602","observation_id":"99b02e2e-4e30-4fe4-b256-2aa84fdd1ce2","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Masked autoencoder for self-supervised pre-training on lidar point clouds,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:814a0d0a1e04fd9e289ea2ee968170bed93ed381b5a087c9ceb925c24bf126d2","observation_id":"c6898dc8-6f24-495a-a8b0-c1e20098a62c","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Bev-mae: Bird’s eye view masked autoencoders for point cloud pre-training in autonomous driving scenarios,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:f4758995523736671cb9cef80b1886f5a9aac24800330ef9a09cc130ad73e36e","observation_id":"0006f65d-dda1-4cf4-8d34-f402a52157d9","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Is pseudo- lidar needed for monocular 3d object detection?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:91fa89c0f7254c2bf6b6d588bb7c92c7672f421bdf926f4354d52c460b9d5606","observation_id":"cd5233cc-fe29-4734-a119-42b6ef0e4f4d","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Pimae: Point cloud and image interactive masked autoencoders for 3d object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:7279ef54bf0eee9845b3ba8a0ec564919e2bb2fc4216e7bd7e2f6e33a0b0e842","observation_id":"39df89d9-ffd3-4f4f-ad55-a2d23c765896","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Point cloud forecasting as a proxy for 4d occupancy forecasting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:753fee5ed7b560e5b3a6154a7d26c1f09bd2dbbb35fa00d2a4f5e31957501d0e","observation_id":"2324b04e-cca9-4898-ac0a-ecbfbe070659","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.07234","last_updated":"2023-08-14T16:17:13Z","snapshot_observed_at":"2026-08-07T10:33:17.199496Z","submitted_at":"2023-08-14T16:17:13Z","title":"UniWorld: Autonomous Driving Pre-training via World Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.07234","snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Uniworld: Au- tonomous driving pre-training via world models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"cited_paper":"/paper/2308.07234","citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:6659be5af00bf04e0a8bed5a092f09262b0d2a7294e0078d7fd8bdc49e8fad49","observation_id":"db276bf3-a01a-4839-a03c-3a972a2ae897","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Driveworld: 4d pre- trained scene understanding via world models for autonomous driving,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:cf54b62b119e859f42f2f09e7060f49ce540943718f62517616ead04c71b8763","observation_id":"964ab74a-477c-4f8b-90ce-6a789f4a4b70","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Crt-fusion: Camera, radar, temporal fusion using motion information for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ef6e1f59022a78638e7bf9f78b9f970ef924b3736805eb446b19113510227d83","observation_id":"72006e77-9a10-44b5-93c6-7e6a66738a99","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Cross-modality knowledge distillation network for monocular 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ef3e28ca5862ca32f2876c2d42defbf7347f04da4a02a741cf2bd40264657547","observation_id":"5879092a-c1fe-49cc-bba2-38b39952cabe","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"X-align: Cross-modal cross-view alignment for bird’s-eye-view segmentation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:efa16c231ac0d7802a584af2d5cb9209a988bf97f66c0615aadca2c51b177545","observation_id":"00c5814f-4724-4f08-80c1-d6b99386c498","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Unifying voxel-based representation with transformer for 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:68c3c0c038bbbf04c45d0f69a39e93f6c0834fc95496e7aecbcc533b4de04958","observation_id":"e81bfd8c-db19-4058-84e6-365b16beb067","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Masked au- toencoders are scalable vision learners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:7511e8cfcedd3d86085b6020817e5e15873e42f096ab28804efa04b78189e3c5","observation_id":"e85eebda-ed7d-4620-9866-de419687b7aa","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Point-bert: Pre-training 3d point cloud transformers with masked point modeling,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:e18695afbaaafd0ed08000814d7a260d578904b4360c256e0d91ab2531b70c7f","observation_id":"bf3b9b43-17d9-4164-a122-d06db045b272","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Masked autoencoders for point cloud self-supervised learning,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:1bfb8bcd03e4a71cdb66a48ed27be0855b475195a6576e1057e0e1d198a6a059","observation_id":"858884ce-d266-417c-b1e8-613a285df5d9","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Exploring geometry-aware contrast and clustering harmonization for self-supervised 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:faa3c2cfafb72c8908217ac2cd074204628ff1b48ad648cf02dc6a84a626c70a","observation_id":"335f2fe5-99c6-4d37-ba35-5f8495595ff1","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Visionpad: A vision-centric pre-training paradigm for autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:efd5b0ba0464804ccee53bd569c2add0513c3fe4ff7241e634138f38a7d1dd20","observation_id":"2e94a117-8695-4af8-ab03-802e1e9a4554","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Bootstrapping autonomous driving radars with self-supervised learn- ing,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:fd4d5bee75611d8e5419f1ce11c961174def208c536d12378e72748d44e4669e","observation_id":"28933d85-e0ad-426d-bae8-c298d908c191","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Self-supervised sparse sensor fusion for long range percep- tion,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:ebb69ab6a30d7185bbfa4d8d9a10135ffea02a00a1e2bba6d38e344b90b16141","observation_id":"807615f1-767c-4ceb-8282-76bb6c1003ea","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Multi-sensor fusion in automated driving: A survey,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:6145f65857151d0e25b0461d0ac3bebd5c05ebffe8eb3c2f0f2925feb3257c52","observation_id":"d7015175-c733-4c9a-9618-126bff329aed","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Radar-camera fusion for object detection and semantic segmentation in autonomous driving: A comprehensive review,","venue":null,"work_id":null,"year":2094},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:9da59360b47ad7003b15ae9638442c06ace089a52a17c7977ef293e0bfb938f9","observation_id":"16b50faf-2f58-4de9-914b-88ca657d651c","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Cramnet: Camera-radar fusion with ray-constrained cross-attention for robust 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:214c9daa577ecaf2142f0bc44f81429587cb2e598e914092db2eee73206362e9","observation_id":"738ddddb-499d-4da1-b27d-e84f6200fbef","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Mvfusion: Multi-view 3d object detection with semantic-aligned radar and camera fusion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:9a7939d0193c11bc019abab7eab06e49de961067b27970685a980fa12d935b8b","observation_id":"d961c668-6e69-4e39-98f3-7095d73fff3f","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17895","last_updated":"2023-08-30T02:10:53Z","snapshot_observed_at":"2026-07-06T15:10:26.549542Z","submitted_at":"2023-03-31T08:56:29Z","title":"EA-LSS: Edge-aware Lift-splat-shot Framework for 3D BEV Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17895","snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Ea-lss: Edge-aware lift-splat-shot framework for 3d bev object detection,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"cited_paper":"/paper/2303.17895","citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:68bf013e647b4a6cd4bd50412cd7c0c0c34ea550200fabe43103c5e541125be7","observation_id":"d29ed390-1250-4158-97ab-2fb5bea753df","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Rcbevdet: Radar-camera fusion in bird’s eye view for 3d object detection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:6b8f1a24f5ebf25d9f6013d8326e78d298e60b3e679b31192a5d514588bb4245","observation_id":"c4536b1d-f098-4986-8599-9a7a7c43c7ce","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Sparc-ad: A baseline for radar-camera fusion in end-to-end autonomous driving,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:95a595770822482045e27428ab32130ee93e03b6d313b42818b8b770d8a1c712","observation_id":"a09c2691-f83a-41ed-aad7-ab5317dbfa52","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14729","last_updated":"2025-08-13T09:10:30Z","snapshot_observed_at":"2026-08-06T09:11:30.127816Z","submitted_at":"2025-01-24T18:59:51Z","title":"HERMES: A Unified Self-Driving World Model for Simultaneous 3D Scene Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14729","snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Hermes: A unified self-driving world model for simultaneous 3d scene understanding and generation,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"cited_paper":"/paper/2501.14729","citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:1d6fde9d9b3459ab77a14967e1db864b900c4fc6f3660ba5a93d9201762b3497","observation_id":"adf4a1c5-6851-4433-b54b-8de23a192288","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Gated attention for large language models: Non-linearity, sparsity, and attention-sink-free,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:9c9191095971e8c77a54e85413149f03da4e0490b435a5a4614d4def9b4890cd","observation_id":"69a3f444-99c5-4e16-83bc-76bdc7d437b3","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:da0f6f1ec4003486d0f44aeec93cf2cb5a654a6a9e0066f1c64b19fbcdaacea7","observation_id":"cc6822de-a09a-403d-bcdd-e6c34f84ac4b","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Fcos3d: Fully convolutional one- stage monocular 3d object detection,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:0516ca4220f099930ced93e698ec04d4cb1672f7347217bbb10c63e28e7a7621","observation_id":"01de08d9-d58c-4beb-b7ed-b19f3705b91f","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Feature pyramid networks for object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:c8dd847976794293281ce36d677e7a6899b9200cf9fdb5ec2791ccc704cb4cf1","observation_id":"db2f2d82-e78a-4425-bcee-6e01fdc81182","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Pointpillars: Fast encoders for object detection from point clouds,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:606890a90ec9b530bc1b456578cadd9101b833c2aed4d53d2789f0d72b6806a9","observation_id":"b9176a1c-c29d-4909-bd7f-019569d38310","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"Bevformer: learning bird’s-eye-view representation from lidar-camera JOURNAL OF LATEX CLASS FILES, VOL. 14, NO. 8, AUGUST 2021 17 via spatiotemporal transformers,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:51d309a4b1acf25e9257453e8e193ce22a9649f7694753dd1f2120dc5dc7d324","observation_id":"6d3aa147-eb36-428a-b164-6ce086c0082b","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11810","last_updated":"2022-02-04T02:50:02Z","snapshot_observed_at":"2026-08-09T09:38:45.203903Z","submitted_at":"2021-06-22T14:24:55Z","title":"NuPlan: A closed-loop ML-based planning benchmark for autonomous vehicles","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.11810","snapshot_observed_at":"2026-07-11T17:41:06.399906Z","title":"nuplan: A closed-loop ml- based planning benchmark for autonomous vehicles,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-11T17:41:06.399906Z"},"links":{"cited_paper":"/paper/2106.11810","citing_paper":"/paper/2607.04541"},"observation_digest":"sha256:5a8ddb037bea4dbf79f35b1a41d3f44e75ae53098c20c0ba4af0fb0ce835a17c","observation_id":"d98dfb6f-0704-49f5-928d-b13aab3f06ca","resolution":{"observed_at":"2026-07-11T17:41:06.399906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04541","last_updated":"2026-07-05T23:07:45Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T09:39:15.899462Z","submitted_at":"2026-07-05T23:07:45Z","title":"CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.04541."}