{"as_of":"2026-08-15T16:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:420c42f74ae462c68cf7827964e4cef0477fdc92bca44461cebc3df604022da9","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T19:28:32.866993Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.10715/citation-record","integrity":"/paper/2411.10715/integrity","json":"/paper/2411.10715/citation-record.json","paper":"/paper/2411.10715"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.348453Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transform- ers","venue":null,"work_id":"baae2ee2-ed1d-4196-9f05-aead96956817","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.869339Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:3d238f492bcced2dae0e79495b4d79c6cbc540804627ce5c3bd0d0a3f7231c51","observation_id":"cf34b8cf-97eb-463f-9cd9-2f91a96750f6","resolution":{"observed_at":"2026-08-12T19:28:34.356826Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.902701Z","title":"nuscenes: A multi- modal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.902701Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:cca67a4eaed67868cd80665aa3b0918c1cd3f99f2786ebb22708759c6bdb949b","observation_id":"831a497f-5d72-44a3-8a01-048fa561c219","resolution":{"observed_at":"2026-08-12T19:28:31.902701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17099","last_updated":"2023-03-30T02:18:07Z","snapshot_observed_at":"2026-08-13T12:13:37.338048Z","submitted_at":"2023-03-30T02:18:07Z","title":"BEVFusion4D: Learning LiDAR-Camera Fusion Under Bird's-Eye-View via Cross-Modality Guidance and Temporal Aggregation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17099","snapshot_observed_at":"2026-08-12T19:28:31.945210Z","title":"Bevfusion4d: Learn- ing lidar-camera fusion under bird’s-eye-view via cross- modality guidance and temporal aggregation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.945210Z"},"links":{"cited_paper":"/paper/2303.17099","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:ce28da0c620c0ecbc2cd686e62c269ebf514f8f5134ceefaec6aa64ae3622d37","observation_id":"9cdc39d3-77ac-4cd9-837f-fe535a365661","resolution":{"observed_at":"2026-08-12T19:28:31.945210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.315416Z","title":"Objectfusion: Multi-modal 3d object detection with object-centric fusion","venue":null,"work_id":"f5aed59e-944a-49b3-9bf2-39a0abe65c20","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.952456Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:720a607db8dda524de83a1d525c24def14e7866dbeb66e3aa345a915e44691c0","observation_id":"ba345c00-23e6-4c50-84dc-0c33205e9177","resolution":{"observed_at":"2026-08-12T19:28:34.324462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.960051Z","title":"Futr3d: A unified sensor fusion framework for 3d detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.960051Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:54373553828f4839bd13978e2a68f003db3cd85933a8cacf141a7cff42c5a153","observation_id":"df852ae9-8fd4-47a0-8677-3426972f01fd","resolution":{"observed_at":"2026-08-12T19:28:31.960051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.274198Z","title":"Focal- former3d: focusing on hard instance for 3d object detection","venue":null,"work_id":"a921804d-f19e-4d8e-b179-fe2c625332bd","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.966404Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:34401177e24c803d54f06fd243fd60456b373516b67de16e2bfb8a123495bb4c","observation_id":"d326804a-495d-447c-91f9-b19b9c4e3102","resolution":{"observed_at":"2026-08-12T19:28:34.281120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:31.973386Z","title":"Deformable feature aggregation for dynamic multi-modal 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.973386Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f030f871645131858ec872f72ebf0e71067125e4d61baa7412e498357ba53dc4","observation_id":"1cc38717-a2b4-40fb-91d2-b16553222e95","resolution":{"observed_at":"2026-08-12T19:28:31.973386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.06493","last_updated":"2022-04-21T01:52:05Z","snapshot_observed_at":"2026-08-13T16:58:04.096441Z","submitted_at":"2022-01-17T16:08:57Z","title":"AutoAlign: Pixel-Instance Feature Aggregation for Multi-Modal 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.06493","snapshot_observed_at":"2026-08-12T19:28:31.979698Z","title":"Autoalign: pixel-instance feature aggregation for multi- modal 3d object detection.arXiv preprint arXiv:2201.06493,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.979698Z"},"links":{"cited_paper":"/paper/2201.06493","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:81c77bb88b526ab08386577882582619c2674a5de907cfd081a329aaf1352d31","observation_id":"000040bf-6d9c-4652-a0e4-886a086bbae2","resolution":{"observed_at":"2026-08-12T19:28:31.979698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.241728Z","title":"Li3detr: A li- dar based 3d detection transformer","venue":null,"work_id":"6ccf5403-087f-4a1b-a65b-9bbb48721bbe","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.986071Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:409fe7799d1c14c02671572b217c0174d94781b3e6a72f95a6c93cee7d4de6e3","observation_id":"80d41623-02eb-4ff9-ab5e-091d93f53cba","resolution":{"observed_at":"2026-08-12T19:28:34.247997Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.213917Z","title":"Adamixer: A fast-converging query-based object detector","venue":null,"work_id":"862116f2-b171-49ee-9d0c-215ce94907a8","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.992416Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:b405842c8795df34a4bb74e701f8d5ade82368c20d235b2ee441aa2eb8e6965e","observation_id":"1b2aa19d-a697-4fc9-bee0-4efde8581b5a","resolution":{"observed_at":"2026-08-12T19:28:34.221067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.189910Z","title":"Deep residual learning for image recognition","venue":null,"work_id":"3b55f2da-3394-4797-8362-2ad5f8f0da7f","year":2016},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:31.997847Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:cf5dca781dfab607d62c722a7d3a03514ade4da2c4049bda0eae5b23874c3f5c","observation_id":"cc1897e8-9e8f-4d78-b1fc-36d58d4269e4","resolution":{"observed_at":"2026-08-12T19:28:34.196184Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05257","last_updated":"2023-10-09T02:09:11Z","snapshot_observed_at":"2026-08-13T10:16:54.596497Z","submitted_at":"2023-09-11T06:27:25Z","title":"FusionFormer: A Multi-sensory Fusion in Bird's-Eye-View and Temporal Consistent Transformer for 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05257","snapshot_observed_at":"2026-08-12T19:28:32.026565Z","title":"Fusionformer: A multi-sensory fu- sion in bird’s-eye-view and temporal consistent transformer for 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.026565Z"},"links":{"cited_paper":"/paper/2309.05257","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:46f0ebfb5b7a3975807b8911ca9fa24b6d60456d70cbe25bdaf9f1a3df105743","observation_id":"b5f09690-b9c6-4449-851b-f0a9da5c29b9","resolution":{"observed_at":"2026-08-12T19:28:32.026565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17895","last_updated":"2023-08-30T02:10:53Z","snapshot_observed_at":"2026-08-14T00:57:03.212149Z","submitted_at":"2023-03-31T08:56:29Z","title":"EA-LSS: Edge-aware Lift-splat-shot Framework for 3D BEV Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17895","snapshot_observed_at":"2026-08-12T19:28:32.073565Z","title":"Ea-lss: Edge-aware lift-splat-shot framework for 3d bev ob- ject detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.073565Z"},"links":{"cited_paper":"/paper/2303.17895","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:dae144f2c5c7a0c167ceafd58ee659e68a97989530599569049ebd76fc48eb75","observation_id":"c57c0f88-cab8-4ab1-bac7-078e928635af","resolution":{"observed_at":"2026-08-12T19:28:32.073565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17054","last_updated":"2022-06-16T09:44:08Z","snapshot_observed_at":"2026-08-14T23:33:45.566779Z","submitted_at":"2022-03-31T14:21:19Z","title":"BEVDet4D: Exploit Temporal Cues in Multi-camera 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17054","snapshot_observed_at":"2026-08-12T19:28:32.100561Z","title":"Bevdet4d: Exploit tempo- ral cues in multi-camera 3d object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.100561Z"},"links":{"cited_paper":"/paper/2203.17054","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e86423b1bbee3e72962d0082d1ec31ce7e6fdae7cc68eb2d8ee84419be0fa7ae","observation_id":"8624b5a5-52ff-43fc-b83e-7b8d73ff62ab","resolution":{"observed_at":"2026-08-12T19:28:32.100561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-12T19:28:32.110177Z","title":"Bevdet: High-performance multi-camera 3d object de- tection in bird-eye-view","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.110177Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:b79ea9d0bf3d4a1cfa8b27e70c962e1a6ca058a1307a255cf6e5bbdaa07eaeca","observation_id":"529056fc-d4a2-4640-9363-78d345cb6783","resolution":{"observed_at":"2026-08-12T19:28:32.110177Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.171554Z","title":"Far3d: Expanding the horizon for surround-view 3d object detec- tion","venue":null,"work_id":"d157a7d2-df2a-4ec9-9ccc-63a75cc461cb","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.117315Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:32d6b2be19ec3d6e47cc85dd913823f3635aa5c1b95135e77e0c01734d3ab212","observation_id":"90c89b00-7150-4bd5-9216-75d36552350c","resolution":{"observed_at":"2026-08-12T19:28:34.177090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.146332Z","title":"Msmdfusion: Fusing lidar and camera at multiple scales with multi-depth seeds for 3d ob- ject detection","venue":null,"work_id":"882e365a-2b5c-437c-bed7-1e006bc3b19d","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.123896Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:41a6275029da76dea3a58648ee2dfd6f708a7a703534b52580f64f602b2ac4c5","observation_id":"41f62e9f-b0e6-4a1a-8721-3ba7d64d5c6b","resolution":{"observed_at":"2026-08-12T19:28:34.152651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.122450Z","title":"Centermask: Real-time anchor-free instance segmentation","venue":null,"work_id":"744aafa7-cb75-449a-bb52-954f3e153561","year":2020},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.132234Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:40d07d7e1b254274f6c070a0dfe0b4a89a37be48ef37e890a4f66f4a7c63568f","observation_id":"dd3d40dd-fbd1-4db6-bd2a-a50017551b09","resolution":{"observed_at":"2026-08-12T19:28:34.129462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.102166Z","title":"Dn-detr: Accelerate detr training by intro- ducing query denoising","venue":null,"work_id":"15d36da2-10a7-439b-afbc-02cef284a617","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.139659Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:c162099a372fd4af1a8996d7cb9402ccce398a85c2d45cb6706ed6e6d96b834e","observation_id":"d540e775-3042-4f19-8dd5-9d4307478b73","resolution":{"observed_at":"2026-08-12T19:28:34.107666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.078569Z","title":"Gafusion: Adaptive fusing lidar and camera with multi- ple guidance for 3d object detection","venue":null,"work_id":"7c574195-1397-41b2-8cb5-f0ee2464c121","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.147120Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:3d0a073e6245f9779410fdf6c0202c1430f2ac8b85f4e74cca919ef1b95cfbcb","observation_id":"eda1fe5b-6c09-458c-8853-54738a770d88","resolution":{"observed_at":"2026-08-12T19:28:34.087414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.054523Z","title":"Unifying voxel-based representation with transformer for 3d object detection","venue":null,"work_id":"f9df099d-ae38-49eb-973f-0deedb79dbd7","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.187755Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:1b8a220237aef4781bc51b74a17bd129e9324e990308f143fa960b137b2dfffd","observation_id":"633861bd-206c-4d43-9e82-cab98f7642cc","resolution":{"observed_at":"2026-08-12T19:28:34.062138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.035214Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":"5ecc60d8-6459-4829-af67-aed566d3e7f4","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.252018Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:c9c0b4726539d318f463196091dbc96030a4f43f8f4c4f5dc8af5dfcf880027c","observation_id":"d26534f8-9184-474a-a38b-09bb6f801027","resolution":{"observed_at":"2026-08-12T19:28:34.040921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:34.014762Z","title":"Fast-bev: A fast and strong bird’s- eye view perception baseline","venue":null,"work_id":"ed21813c-45ee-49d0-b53a-18344658364f","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.258150Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:9223f52adcfa08d33032d5213c983319ad626a9ebd6b41a848207790783e7e0b","observation_id":"195c2a61-2a56-487a-a9d3-efa5a5848897","resolution":{"observed_at":"2026-08-12T19:28:34.020290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.264382Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.264382Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:6949058d88b17e4893e43ef5c5a783e5c1e0c5b9905f2e684852d980b61fddcf","observation_id":"9ef83d42-a8b3-4692-ac9a-4dd59905c3be","resolution":{"observed_at":"2026-08-12T19:28:32.264382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.965913Z","title":"Bevfusion: A simple and robust lidar-camera fusion framework","venue":null,"work_id":"3bc7b1f3-6c3b-4de0-9469-267ad6506444","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.270371Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f5b72ea2a3d803315d2a7c3644c175d25f802ee76f1b54877c05dde3621e5690","observation_id":"e6f6b9fe-c088-4b14-879b-a74451b72c3d","resolution":{"observed_at":"2026-08-12T19:28:33.972462Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.276545Z","title":"Feature pyra- mid networks for object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.276545Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e2d1125fbee703bd43fb53f5388c30902425495f2241225f575c05d460bcb6db","observation_id":"923fb104-c073-41ce-a7c0-94a155be2e4b","resolution":{"observed_at":"2026-08-12T19:28:32.276545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.928120Z","title":"Sparsebev: High-performance sparse 3d object de- tection from multi-camera videos","venue":null,"work_id":"a1d20bcc-ce75-4a01-b0ef-a97842a8932a","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.288586Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:eb1bccba6359fce86897ca5405ecadd4f64a047cefcac390e305cd7b864cce36","observation_id":"6331c775-a5b6-4b73-a6d9-ff63cd19df36","resolution":{"observed_at":"2026-08-12T19:28:33.933417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12329","last_updated":"2022-03-30T16:04:38Z","snapshot_observed_at":"2026-08-13T07:13:08.660859Z","submitted_at":"2022-01-28T18:51:09Z","title":"DAB-DETR: Dynamic Anchor Boxes are Better Queries for DETR","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12329","snapshot_observed_at":"2026-08-12T19:28:32.349200Z","title":"Dab-detr: Dynamic anchor boxes are better queries for detr","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.349200Z"},"links":{"cited_paper":"/paper/2201.12329","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f16e050f374655985de80519a28681ce8843cb94e7557be271d083cd656377fd","observation_id":"d4560ec2-925c-499d-9383-79c3165e1b88","resolution":{"observed_at":"2026-08-12T19:28:32.349200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.910706Z","title":"Petr: Position embedding transformation for multi-view 3d object detection","venue":null,"work_id":"422555d5-040c-4bbf-8f26-77f87feace9f","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.389505Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:fa4a0f37ed6486a182ff07a21eaadc9278cf5c03729d42b3d54fa3e33ba40266","observation_id":"e4e42334-4b28-4ebf-a877-f52f50e8dead","resolution":{"observed_at":"2026-08-12T19:28:33.916200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.893169Z","title":"Petrv2: A unified framework for 3d perception from multi-camera images","venue":null,"work_id":"05277240-d6b8-438d-bd16-74e72b88072d","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.396866Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:1c351a8d155f369916e0bebe7f33f0bfe012b94d34b58a25ce6f9076c60dd416","observation_id":"d9c64888-8943-46c3-b6b3-26b7948b1dd2","resolution":{"observed_at":"2026-08-12T19:28:33.898541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.874203Z","title":"Bevfusion: Multi- task multi-sensor fusion with unified bird’s-eye view repre- sentation","venue":null,"work_id":"82c6a8eb-3d9c-4e12-a726-91b2e2661787","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.403024Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:8dabca199ebe81aa8c330bb418bcdc72b094cfaf171400e7f22635b4697ce5d0","observation_id":"9a4c979a-4e49-4e10-82c4-c4b8b8e122b3","resolution":{"observed_at":"2026-08-12T19:28:33.880251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.409589Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.409589Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f90eae87d7eeb7e6b164ff8302eed90065575ce12a0d2b2458b813463e8ad8b1","observation_id":"3df95c01-9555-4966-a908-6f2004176533","resolution":{"observed_at":"2026-08-12T19:28:32.409589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07849","last_updated":"2022-12-15T14:18:47Z","snapshot_observed_at":"2026-08-14T22:23:01.193384Z","submitted_at":"2022-12-15T14:18:47Z","title":"DETR4D: Direct Multi-View 3D Object Detection with Sparse Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07849","snapshot_observed_at":"2026-08-12T19:28:32.417165Z","title":"Detr4d: Direct multi-view 3d object detection with sparse attention","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.417165Z"},"links":{"cited_paper":"/paper/2212.07849","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:0d5d1499e03b05ac450a789d662c269ede47e1c9b3d22686b6b4400418bca988","observation_id":"6e2743bd-466a-4abd-ade4-bc393fa33d7b","resolution":{"observed_at":"2026-08-12T19:28:32.417165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.473306Z","title":"Lift, splat, shoot: Encod- ing images from arbitrary camera rigs by implicitly unpro- jecting to 3d","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.473306Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:4d1c2d08c8139f0a29f9683c2ccbd14fd6a07f5ed064a31378c06245d3a9fac5","observation_id":"a6aa273d-edaa-4cac-a3e3-dc0251ef65e8","resolution":{"observed_at":"2026-08-12T19:28:32.473306Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.526518Z","title":"Categorical depth distribution network for monocular 3d object detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.526518Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:d9ab1b622889dc057952f80ee05b803fd761d7750c1235f693b4eb2e6b7df3f1","observation_id":"713536b3-5403-487e-b5ab-765cdf112c45","resolution":{"observed_at":"2026-08-12T19:28:32.526518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.533375Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.533375Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:431b34a170d968e7fb55531c4b25999a5c9aca2705c8603e9f1c2566e5710b1b","observation_id":"39402c44-1e5e-4d69-aa7a-e5655a14d85f","resolution":{"observed_at":"2026-08-12T19:28:32.533375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.540886Z","title":"Cyclical learning rates for training neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.540886Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:c5af62a714ab81699d7e177f51a1177070a5217107761a590e54b46b5ac8ed4e","observation_id":"3c7976a6-4263-4681-9bca-286c31ecf2d5","resolution":{"observed_at":"2026-08-12T19:28:32.540886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.774354Z","title":"Attention is all you need","venue":null,"work_id":"538bb23d-d725-4b9b-8cb3-fa51b3b5f7a4","year":2017},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.547697Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:429d5d17e11382d4ea0e44cd57db3e460b483df0d3dea458118535518a7c35e4","observation_id":"01a03ecf-58fd-43a4-91ce-6c44abcfb3fb","resolution":{"observed_at":"2026-08-12T19:28:33.782414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.553384Z","title":"Pointpainting: Sequential fusion for 3d object de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.553384Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:acc0a0113b3f7fcae7fcf769676bf0148aadd7584aa1fc7deeaf370dc4f86db0","observation_id":"ca45c5d4-86e2-4fc5-ba7a-b8b2a9ef9295","resolution":{"observed_at":"2026-08-12T19:28:32.553384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.730965Z","title":"Unitr: A unified and efficient multi-modal transformer for bird’s-eye-view repre- sentation","venue":null,"work_id":"ccd952a3-ce66-4358-b5d2-ac173966d3db","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.559169Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:b85062ea2bfc08e38899a22de1123f20fa196c5a03265aa9c5bb7b973b8099d0","observation_id":"38f4380e-b09d-4b7c-949b-cd9e077f00db","resolution":{"observed_at":"2026-08-12T19:28:33.738673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.711101Z","title":null,"venue":null,"work_id":"d61b21dd-73fc-4280-9f75-682567f3c670","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.564250Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:c7b82f161be32508516ef016873d8117e84509138698182fd629ca1667bc6d0a","observation_id":"9433cc5e-d441-4f00-a1bc-487f80013518","resolution":{"observed_at":"2026-08-12T19:28:33.716692Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.687875Z","title":"Exploring object-centric temporal modeling for efficient multi-view 3d object detection","venue":null,"work_id":"817d54c2-c4c0-4019-b9d9-7e7da60af00b","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.570535Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:f7d41c71b875a602b08766d92299f7833f567b4a9db9290699b6975302544f1b","observation_id":"31193498-e793-4c76-b2cc-cdb91510b183","resolution":{"observed_at":"2026-08-12T19:28:33.694585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.667155Z","title":"Detr3d: 3d object detection from multi-view images via 3d-to-2d queries","venue":null,"work_id":"7328eeb2-ddd0-438b-9961-3bf2640b5f71","year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.576703Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:e7b3acf2681c0a6153f7186970d9a67a4838c3ce0b42ba8b2ee285299a2f744c","observation_id":"5da9b462-c8e6-47cd-a085-3d26e0abc278","resolution":{"observed_at":"2026-08-12T19:28:33.675157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05945","last_updated":"2025-07-03T05:37:48Z","snapshot_observed_at":"2026-08-12T23:05:11.649111Z","submitted_at":"2024-08-12T06:46:05Z","title":"MV2DFusion: Leveraging Modality-Specific Object Semantics for Multi-Modal 3D Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05945","snapshot_observed_at":"2026-08-12T19:28:32.581814Z","title":"Mv2dfusion: Leveraging modality-specific object semantics for multi-modal 3d detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.581814Z"},"links":{"cited_paper":"/paper/2408.05945","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:8b1f0f9302849f527c5b31f774971f1fc629169669a7c439cbbcc85e3a9c40df","observation_id":"dbd26f5a-ede3-45d9-9a24-5a8c516ac9d6","resolution":{"observed_at":"2026-08-12T19:28:32.581814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.643526Z","title":"Sparsefusion: Fusing multi-modal sparse rep- resentations for multi-sensor 3d object detection","venue":null,"work_id":"cffc7329-93e9-427d-a294-e8fcad485171","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.636500Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:eef102621ed95dbdd1afcf83a0fddfdff351857c2d259437adbe61c37756040e","observation_id":"34b09d61-d230-4752-9ab5-acd1aceee89c","resolution":{"observed_at":"2026-08-12T19:28:33.651370Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.618772Z","title":"Cross modal trans- former: Towards fast and robust 3d object detection","venue":null,"work_id":"cda3b7f6-145e-41ca-85be-64c97b093e4b","year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.681023Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:58a6c48bc466283ad5b5ee36a916496972422004f55ec4cf7229d61e537744ae","observation_id":"545362d3-1372-4ecd-94ec-8cea2e99e7ef","resolution":{"observed_at":"2026-08-12T19:28:33.624715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.590120Z","title":"Second: Sparsely embed- ded convolutional detection","venue":null,"work_id":"ce4d7ca6-4575-4b3a-a4f6-d51e61256806","year":2018},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.686676Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:aadbaf9797d4464de2f191b0774c4cbf193b247fff9a1f1d41cac16ff4505217","observation_id":"e0ed78f5-633e-4b80-9302-1e313eb20f62","resolution":{"observed_at":"2026-08-12T19:28:33.601168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:32.694155Z","title":"Bevformer v2: Adapting modern image backbones to bird’s-eye-view recognition via perspective su- pervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.694155Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:c8c1d311471cc94716d5b1d0d7e41de13d8c3ef5aac32906c248e687106d718a","observation_id":"acfb5e71-4fb1-4d32-800e-5829fb21f471","resolution":{"observed_at":"2026-08-12T19:28:32.694155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.547631Z","title":"Deepinteraction: 3d object detection via modality interaction","venue":null,"work_id":"44f1434e-7d0a-4db7-b68b-2e6c966d2fda","year":1992},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.700956Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:ab3d068ce491c47e1f9a84a9ea4df9395756f1217dbe7f5ea5a5eff8bcb73002","observation_id":"dfef9795-ebcb-4d7d-8300-72ca824feeb4","resolution":{"observed_at":"2026-08-12T19:28:33.555150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05075","last_updated":"2025-02-21T11:35:26Z","snapshot_observed_at":"2026-08-12T23:05:59.567686Z","submitted_at":"2024-08-09T14:04:21Z","title":"DeepInteraction++: Multi-Modality Interaction for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05075","snapshot_observed_at":"2026-08-12T19:28:32.705803Z","title":"Deepinteraction++: Multi-modality interaction for autonomous driving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.705803Z"},"links":{"cited_paper":"/paper/2408.05075","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:7a949855cef7e62887a7ad95e0f0152508957ff86d35c8db747b14b486e168c5","observation_id":"88b54127-fd66-471d-9912-1d16bbf095de","resolution":{"observed_at":"2026-08-12T19:28:32.705803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.522991Z","title":"Is-fusion: Instance-scene collaborative fusion for multimodal 3d ob- ject detection","venue":null,"work_id":"47090a38-8dc1-4a38-9081-2757650c9843","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.714103Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:b3762c57fe4fbe21003c20e8e88c147f3761c987615865e0de75de27ac36c044","observation_id":"2b76b5ee-3b94-4e1e-a582-7b4dd311ea82","resolution":{"observed_at":"2026-08-12T19:28:33.530527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.501356Z","title":"Center- based 3d object detection and tracking","venue":null,"work_id":"f7527b4f-6013-41f8-8f6a-3911355aa908","year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.721909Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:9c37f77f966b34e35b560e9b6085d3321ea196118dddb21634670590d31b01c7","observation_id":"6781b3c6-4158-41da-a7cd-142cc06a06fb","resolution":{"observed_at":"2026-08-12T19:28:33.509180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.474813Z","title":"Multi- modal virtual point 3d detection","venue":null,"work_id":"5c81bb2d-a107-4750-99dc-f19abaa3f617","year":2021},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.783175Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:79bdb5a283c4c231a23a62af6153de259639ae7911f614d227fad88119215127","observation_id":"58607b24-2237-4a45-a873-7aacf3030b23","resolution":{"observed_at":"2026-08-12T19:28:33.482646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-07T03:38:32.486362Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-12T19:28:32.828663Z","title":"Dino: Detr with improved denoising anchor boxes for end-to-end object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.828663Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:3c876ad25c00d5a844f7eda602de0bc36bfe4175503c5de456f9ccf5db363e04","observation_id":"431aa5a5-6523-46d0-869d-d4cf80606bb9","resolution":{"observed_at":"2026-08-12T19:28:32.828663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.406999Z","title":"Sparselif: High-performance sparse lidar- camera fusion for 3d object detection","venue":null,"work_id":"b237ed5f-69e7-492b-ac02-0777cb62a6ed","year":2024},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.833803Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:97df827ccba102dd5b77b8a051299faedbc249ac12c7552600c59eec6fd5a26b","observation_id":"1b0c9fab-649f-4a49-96ac-7b9ebb21924b","resolution":{"observed_at":"2026-08-12T19:28:33.459457Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05292","last_updated":"2024-11-08T02:51:39Z","snapshot_observed_at":"2026-08-12T22:05:07.529353Z","submitted_at":"2024-11-08T02:51:39Z","title":"SimpleBEV: Improved LiDAR-Camera Fusion Architecture for 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05292","snapshot_observed_at":"2026-08-12T19:28:32.841383Z","title":"Simplebev: Improved lidar-camera fusion architecture for 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.841383Z"},"links":{"cited_paper":"/paper/2411.05292","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:15b36686410788ff8644b9e23ac28d975e12c560643149d0a6c63fffb34703c8","observation_id":"d4b743e8-a98a-4ffe-90d4-43c4a94fd101","resolution":{"observed_at":"2026-08-12T19:28:32.841383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.291621Z","title":"V oxelnet: End-to-end learning for point cloud based 3d object detection","venue":null,"work_id":"a47b05b7-3552-4ea6-b993-b2be2293be86","year":2018},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.847930Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:a5b70edadbcb304e302d4a1578ab786450ec703c469a8e5d77053fd8b84b3dda","observation_id":"6e9daa43-c357-4cbc-a104-ca6d2336b3f7","resolution":{"observed_at":"2026-08-12T19:28:33.333466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T19:28:33.266114Z","title":"Centerformer: Center-based transformer for 3d object detection","venue":null,"work_id":"31a4b4c3-9a37-47df-9e8c-76c4c07dfa79","year":2022},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.854555Z"},"links":{"citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:2231c17c6e3164cdab4d98fe6085f4df7154baa32bddf40eb002c4a13c5e5e59","observation_id":"f77c4e70-c88f-41a6-8587-eb0658698e35","resolution":{"observed_at":"2026-08-12T19:28:33.275324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-15T06:32:42.880941+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.09492","last_updated":"2019-08-26T06:27:01Z","snapshot_observed_at":"2026-08-14T21:44:27.735473Z","submitted_at":"2019-08-26T06:27:01Z","title":"Class-balanced Grouping and Sampling for Point Cloud 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.09492","snapshot_observed_at":"2026-08-12T19:28:32.860314Z","title":"Class-balanced grouping and sampling for point cloud 3d object detection","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.860314Z"},"links":{"cited_paper":"/paper/1908.09492","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:42b59b7763ab909197d7fccb0e51c2bc77835b04eaeb6fbfd96b81d5ffdd6df1","observation_id":"44122285-e031-4b7f-9445-9c6d9fc1437d","resolution":{"observed_at":"2026-08-12T19:28:32.860314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-08-13T17:54:01.724774Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-12T19:28:32.866993Z","title":"Deformable detr: Deformable transform- ers for end-to-end object detection","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T19:28:32.866993Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2411.10715"},"observation_digest":"sha256:9917e5752635afb8f7552bfecc9e217fe8191929f45949afa58b45f9d2ec9260","observation_id":"c2c59f5a-8caa-48e3-8951-fb90bccff40d","resolution":{"observed_at":"2026-08-12T19:28:32.866993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.10715","last_updated":"2025-07-11T06:50:01Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-14T15:32:14.458323Z","submitted_at":"2024-11-16T06:11:10Z","title":"EVT: Efficient View Transformation for Multi-Modal 3D Object Detection"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":0,"verified_fuzzy":33},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2411.10715."}