{"as_of":"2026-08-08T07:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2f90a3788ca2ec80128a171ff33b6deb624394deb289c3946b6f64a2c9da15c1","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":37,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:47:13.263203Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:08:22.583557Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2402.13243","last_updated":"2026-04-17T23:12:55Z","snapshot_observed_at":"2026-08-04T01:21:26.466156Z","submitted_at":"2024-02-20T18:55:09Z","title":"VADv2: End-to-End Vectorized Autonomous Driving via Probabilistic Planning","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T03:16:03.058129Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2402.13243"},"observation_digest":"sha256:80200bdde6a912df28c119b4349d8854013303b277732503c4d5a2fc1415aee2","observation_id":"e62581fb-6d06-48b9-b7a1-b77bca286d76","resolution":{"observed_at":"2026-05-24T03:18:49.535690Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2406.08481","last_updated":"2025-02-28T07:43:38Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:21Z","title":"Enhancing End-to-End Autonomous Driving with Latent World Model","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-17T07:38:51.885383Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2406.08481"},"observation_digest":"sha256:a5033818ac36932316870e5c3aef18c10c2b556b9f187fb806eaaca27fcc39d2","observation_id":"b43c0cbb-c37b-456c-8b1c-44108f63848e","resolution":{"observed_at":"2026-05-17T07:38:51.943862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2408.16322","last_updated":"2026-04-28T08:41:21Z","snapshot_observed_at":"2026-07-06T19:07:28.779905Z","submitted_at":"2024-08-29T07:49:31Z","title":"BEVal: A Cross-dataset Evaluation Study of BEV Segmentation Models for Autonomous Driving","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-23T21:25:20.390835Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2408.16322"},"observation_digest":"sha256:e3e29a13274076051351e701ed7f9392752adafe4f3499109170e976182f2d74","observation_id":"0cd24a7c-0bac-45db-8965-9174ce6315cf","resolution":{"observed_at":"2026-05-23T21:25:51.484526Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2410.22313","last_updated":"2024-10-29T17:53:56Z","snapshot_observed_at":"2026-07-31T01:16:26.372370Z","submitted_at":"2024-10-29T17:53:56Z","title":"Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-15T15:24:23.756052Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2410.22313"},"observation_digest":"sha256:241ef8990f10a841e337b2d5aca1447edf90751c3831a917a268d46e6dc00e82","observation_id":"80bad068-16b6-43ad-80b8-bf7d4bd7d0d3","resolution":{"observed_at":"2026-05-15T15:24:23.914142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-07T13:47:13.263203Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers.arXiv preprint arXiv:2203.17270, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21581","last_updated":"2026-06-25T02:34:38Z","snapshot_observed_at":"2026-08-07T13:40:30.128108Z","submitted_at":"2025-05-27T09:58:43Z","title":"CogAD: Cognitive-Hierarchy Guided End-to-End Autonomous Driving","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T13:47:13.263203Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2505.21581"},"observation_digest":"sha256:137386abea52e48482e2009231003276a6f7b0e4ce483f6190a318cf4048b692","observation_id":"f69f2ee9-8c18-4e30-9e69-12438284e762","resolution":{"observed_at":"2026-08-07T13:47:13.263203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-07T13:11:45.426681Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.22461","last_updated":"2025-05-29T14:45:58Z","snapshot_observed_at":"2026-08-07T13:04:22.417271Z","submitted_at":"2025-05-28T15:16:15Z","title":"SHTOcc: Effective 3D Occupancy Prediction with Sparse Head and Tail Voxels","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T13:11:45.426681Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2505.22461"},"observation_digest":"sha256:a5f33b57700564081557f3d25b9f72fcfedb4acc7e4a64a79ccbf38f17bc80dc","observation_id":"c4908c9d-5c01-49b5-9620-2d62f93274a1","resolution":{"observed_at":"2026-08-07T13:11:45.426681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2506.02587","last_updated":"2026-05-04T22:47:10Z","snapshot_observed_at":"2026-08-05T08:04:03.474258Z","submitted_at":"2025-06-03T08:07:18Z","title":"BEVCALIB: LiDAR-Camera Calibration via Geometry-Guided Bird's-Eye View Representations","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-19T11:10:31.571968Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2506.02587"},"observation_digest":"sha256:51ac6a54925c6cac2640c27a9d66e7389547b6f8bc1543feae8e82b58a211a0d","observation_id":"096a0178-c3d0-405d-aea7-f3aec25945d9","resolution":{"observed_at":"2026-05-19T11:12:15.488257Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-07T10:27:09.658408Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers.arXiv preprint arXiv:2203.17270, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.05473","last_updated":"2025-06-05T18:00:11Z","snapshot_observed_at":"2026-08-07T10:18:24.067035Z","submitted_at":"2025-06-05T18:00:11Z","title":"S2GO: Streaming Sparse Gaussian Occupancy Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:27:09.658408Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2506.05473"},"observation_digest":"sha256:11635f6dad5f3a612dce547dcf6b9ea97be25cba6cba397d37a2422adcb9c194","observation_id":"a6edca6f-c2c7-4d14-8e66-efec5e422ac1","resolution":{"observed_at":"2026-08-07T10:27:09.658408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2506.11419","last_updated":"2025-06-13T02:39:01Z","snapshot_observed_at":"2026-08-02T12:38:41.263017Z","submitted_at":"2025-06-13T02:39:01Z","title":"FocalAD: Local Motion Planning for End-to-End Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-19T10:15:53.988156Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2506.11419"},"observation_digest":"sha256:fcf21f8e8713cc779fefd27700542d454e74d44a6b6bbcf1fb61931bdba5b13c","observation_id":"717ab366-15ab-45aa-8d82-ac83504eb1f4","resolution":{"observed_at":"2026-05-19T10:17:15.800775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-06T23:27:22.884613Z","title":"Bev- former: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers. arxiv 2022,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02899","last_updated":"2025-07-11T05:01:20Z","snapshot_observed_at":"2026-08-06T23:20:30.916762Z","submitted_at":"2025-06-23T04:29:08Z","title":"Learning to Generate Vectorized Maps at Intersections with Multiple Roadside Cameras","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:27:22.884613Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2507.02899"},"observation_digest":"sha256:135853a211e09a773721175bd396da6c9594ad36b05b9613db00c8d72f3f30df","observation_id":"bd4ee98a-b979-4876-a424-03869bb94fc0","resolution":{"observed_at":"2026-08-06T23:27:22.884613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-06T10:42:00.957398Z","title":"Bevformer: 9 Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers.arXiv preprint arXiv:2203.17270, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.23567","last_updated":"2025-09-05T15:41:13Z","snapshot_observed_at":"2026-08-08T01:12:00.953493Z","submitted_at":"2025-07-31T13:56:41Z","title":"3D-MOOD: Lifting 2D to 3D for Monocular Open-Set Object Detection","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T10:42:00.957398Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2507.23567"},"observation_digest":"sha256:f630cf248dc101ba74b532264b7c15185cb81e5ec174915f2accc7e92e9aebfd","observation_id":"aa3b2e12-822b-4e27-a50c-77f6bfcf1f42","resolution":{"observed_at":"2026-08-06T10:42:00.957398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-05T22:06:55.337304Z","title":"URL https://arxiv","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07560","last_updated":"2025-08-11T02:40:46Z","snapshot_observed_at":"2026-08-07T04:31:51.628723Z","submitted_at":"2025-08-11T02:40:46Z","title":"Progressive Bird's Eye View Perception for Safety-Critical Autonomous Driving: A Comprehensive Survey","version":1},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-08-05T22:06:55.337304Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2508.07560"},"observation_digest":"sha256:c34283fdf68a9bdc88a1e8c45dce7b2316e8688f6fd3b518be074cd5b5f4a2e1","observation_id":"d418e1cc-9c3e-4074-99fe-07da8eb6ef48","resolution":{"observed_at":"2026-08-05T22:06:55.337304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-05T14:55:48.356558Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20762","last_updated":"2025-08-28T13:17:35Z","snapshot_observed_at":"2026-08-07T23:39:15.636702Z","submitted_at":"2025-08-28T13:17:35Z","title":"SKGE-SWIN: End-To-End Autonomous Vehicle Waypoint Prediction and Navigation Using Skip Stage Swin Transformer","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T14:55:48.356558Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2508.20762"},"observation_digest":"sha256:1ea0e47558b4ef58e89afc2c37a1ff3797dc41ef105e1a72ba0ffb5006aaef81","observation_id":"45ada445-1397-4301-9130-0e54f13ea8f8","resolution":{"observed_at":"2026-08-05T14:55:48.356558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-05T10:42:47.959381Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03837","last_updated":"2025-09-04T02:57:47Z","snapshot_observed_at":"2026-08-05T10:42:46.373951Z","submitted_at":"2025-09-04T02:57:47Z","title":"Vehicle-to-Infrastructure Collaborative Spatial Perception via Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T10:42:47.959381Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2509.03837"},"observation_digest":"sha256:ab874639a18192b55c6c925f60bebb00c325f79bd0721699cda1a2127c916f1b","observation_id":"0b72d4ed-8679-4e5f-a2b2-d9c4406ad130","resolution":{"observed_at":"2026-08-05T10:42:47.959381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-04T20:48:57.622231Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers.arXiv preprint arXiv:2203.17270, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.08388","last_updated":"2025-09-10T08:29:22Z","snapshot_observed_at":"2026-08-04T20:48:53.241357Z","submitted_at":"2025-09-10T08:29:22Z","title":"Semantic Causality-Aware Vision-Based 3D Occupancy Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T20:48:57.622231Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2509.08388"},"observation_digest":"sha256:8b0089b97ced6910e0a4b82ba5d05bc38aa77db7df29688861a052cfa3f64990","observation_id":"6ded0fc4-1f91-46a2-8582-bb5106ccb31b","resolution":{"observed_at":"2026-08-04T20:48:57.622231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-04T09:29:20.708420Z","title":"Bevformer: Learning bird’s- eye-view representation from multi-camera images via spatiotemporal transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2510.15264","last_updated":"2026-05-25T12:48:39Z","snapshot_observed_at":"2026-08-04T09:29:16.602093Z","submitted_at":"2025-10-17T03:00:08Z","title":"DriveGen3D: Boosting Feed-Forward Driving Scene Generation with Efficient Video Diffusion","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T09:29:20.708420Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2510.15264"},"observation_digest":"sha256:4622180cf791a6af4ed78536cde9318fe21d293bb64dada8b7ddd51d762a46d7","observation_id":"73dae037-6dbb-4b3e-83b8-84eb82da462a","resolution":{"observed_at":"2026-08-04T09:29:20.708420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2511.00062","last_updated":"2026-02-24T21:52:50Z","snapshot_observed_at":"2026-07-06T22:34:38.619949Z","submitted_at":"2025-10-28T22:44:13Z","title":"World Simulation with Video Foundation Models for Physical AI","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-12T23:01:13.546110Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2511.00062"},"observation_digest":"sha256:8e378ffa33e40e63dafd90b3a1cd8d69f8c9f1230476c5c1c3f7296e7171f982","observation_id":"f2ee8ce3-f025-44bc-a2cf-8780d356ba4e","resolution":{"observed_at":"2026-05-12T23:01:13.632850Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2512.08237","last_updated":"2026-05-19T02:33:35Z","snapshot_observed_at":"2026-08-03T18:47:31.399133Z","submitted_at":"2025-12-09T04:37:46Z","title":"Fast-BEV++: Fast by Algorithm, Deployable by Design","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-21T18:42:37.182403Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2512.08237"},"observation_digest":"sha256:c121e048fe066adc651a0f4daeec76bd57d3f8645628be5679de8db2175f70c8","observation_id":"4637504e-1921-45fc-ad75-5ca91801d746","resolution":{"observed_at":"2026-05-21T18:44:18.886433Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-03T12:06:27.585778Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers.arXiv preprint arXiv:2203.17270, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.04453","last_updated":"2026-07-01T06:26:33Z","snapshot_observed_at":"2026-08-05T01:50:41.678211Z","submitted_at":"2026-01-07T23:49:52Z","title":"UniDrive-WM: Unified Understanding, Planning and Generation World Model for Autonomous Driving","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T12:06:27.585778Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2601.04453"},"observation_digest":"sha256:cb02297e06b97518a5f9084091d0b1b238e660778df0f734593bd838ca54fcaa","observation_id":"7fddc862-931f-4209-9130-5905bd0d3039","resolution":{"observed_at":"2026-08-03T12:06:27.585778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2603.09573","last_updated":"2026-04-05T10:51:24Z","snapshot_observed_at":"2026-08-02T07:24:36.598047Z","submitted_at":"2026-03-10T12:19:50Z","title":"More than the Sum: Panorama-Language Models for Adverse Omni-Scenes","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-15T13:58:18.635091Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2603.09573"},"observation_digest":"sha256:9d211a8134c27bb110c4f7cce5856fb1495b43062c36e6a036cae1bfbd1c3294","observation_id":"f73c6746-4829-4ace-8259-f46256c95782","resolution":{"observed_at":"2026-05-15T14:00:02.865442Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2604.02930","last_updated":"2026-04-03T09:58:42Z","snapshot_observed_at":"2026-07-06T22:52:10.923214Z","submitted_at":"2026-04-03T09:58:42Z","title":"BEVPredFormer: Spatio-temporal Attention for BEV Instance Prediction in Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T20:00:21.130075Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2604.02930"},"observation_digest":"sha256:c6f8353611ae79aa1da77d6c0b2636de96b3d4bc3199bbe537ee598dae6ce0bc","observation_id":"b4e21461-f0d2-488e-9dbd-eb891e87f78c","resolution":{"observed_at":"2026-05-13T20:03:12.414025Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2604.04797","last_updated":"2026-04-06T16:03:21Z","snapshot_observed_at":"2026-07-06T22:53:41.734429Z","submitted_at":"2026-04-06T16:03:21Z","title":"Multi-Modal Sensor Fusion using Hybrid Attention for Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-10T18:43:52.542973Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2604.04797"},"observation_digest":"sha256:5d5c5f31b3ea212c103f16c78b60f0b8cf5bdf0fecc0e1207f641c1ffef3aa94","observation_id":"442fffd0-908d-4b5e-b539-94bf4942ff64","resolution":{"observed_at":"2026-05-11T00:00:56.801261Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2604.05780","last_updated":"2026-04-07T12:17:31Z","snapshot_observed_at":"2026-08-05T15:51:49.471831Z","submitted_at":"2026-04-07T12:17:31Z","title":"Sparsity-Aware Voxel Attention and Foreground Modulation for 3D Semantic Scene Completion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T20:22:04.663359Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2604.05780"},"observation_digest":"sha256:19c38c25cbe501c49295c9ad0fce052c73b4dd5fa128c9464a3ad3ce43d5efe5","observation_id":"5366bd63-cc7f-4830-be9a-7fa8f7bb297f","resolution":{"observed_at":"2026-05-10T22:00:47.954582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2604.25329","last_updated":"2026-04-28T07:46:30Z","snapshot_observed_at":"2026-07-06T23:11:11.827339Z","submitted_at":"2026-04-28T07:46:30Z","title":"ProDrive: Proactive Planning for Autonomous Driving via Ego-Environment Co-Evolution","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-07T15:58:59.744568Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2604.25329"},"observation_digest":"sha256:2d49c5fbeb370cde9f40d2cb5ed430a8076ad8d0e7964454c45958b0e37bce19","observation_id":"5fa18e0b-93cc-49c5-ac98-343690cc4eb2","resolution":{"observed_at":"2026-05-11T23:56:14.121985Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2605.04355","last_updated":"2026-05-05T23:24:45Z","snapshot_observed_at":"2026-07-06T23:17:09.246351Z","submitted_at":"2026-05-05T23:24:45Z","title":"InterFuserDVS: Event-Enhanced Sensor Fusion for Safe RL-Based Decision Making","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-08T17:01:31.011188Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2605.04355"},"observation_digest":"sha256:edae6053f5863a2150e9420dfcfa86cca65af431118fde6d2fd661b7d2a2fc24","observation_id":"c8d8e482-4ed2-4c66-a9c4-9054d4a82e92","resolution":{"observed_at":"2026-05-11T17:51:09.053667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2605.08412","last_updated":"2026-05-08T19:20:23Z","snapshot_observed_at":"2026-07-31T17:39:51.490689Z","submitted_at":"2026-05-08T19:20:23Z","title":"SYNCR: A Cross-Video Reasoning Benchmark with Synthetic Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T00:53:35.188721Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2605.08412"},"observation_digest":"sha256:71b4c7fca45f131856166bacc6e1b51cb79cfe0cf8b5c3e28fb60f5d46f1298a","observation_id":"2d7ede07-3691-4f8c-8848-21f70c4366bd","resolution":{"observed_at":"2026-05-12T08:36:26.590225Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2605.14191","last_updated":"2026-05-13T23:13:29Z","snapshot_observed_at":"2026-08-01T23:13:44.447855Z","submitted_at":"2026-05-13T23:13:29Z","title":"CoReDiT: Spatial Coherence-Guided Token Pruning and Reconstruction for Efficient Diffusion Transformers","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T04:47:32.476614Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2605.14191"},"observation_digest":"sha256:5a9a0d1a0f4a9f4d5f08929225bb28bd9ba3280264382935445c3cf574bd077a","observation_id":"ef25aee8-786a-4d1c-80fe-cf3bee87bdf5","resolution":{"observed_at":"2026-05-15T04:49:44.370206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2605.21308","last_updated":"2026-05-20T15:36:20Z","snapshot_observed_at":"2026-08-01T20:47:26.608081Z","submitted_at":"2026-05-20T15:36:20Z","title":"Deformba: Vision State Space Model with Adaptive State Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-21T05:03:12.736238Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2605.21308"},"observation_digest":"sha256:a2655ef8ba8c500b9b529fb94a7bca6d4226f0e53dbd68838a962fa2b1356fc4","observation_id":"21f924e8-64f1-450b-98a1-7a4e0013d1ea","resolution":{"observed_at":"2026-05-21T05:03:57.771091Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-02T12:34:11.019179Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T11:11:46.428727Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.03159"},"observation_digest":"sha256:4e337c5fc57b0e0c6d8b5dee1afc049b22c3f184e9b31894f4d97b3b3174a18b","observation_id":"025a8355-0606-4108-856f-3dbb2e19596a","resolution":{"observed_at":"2026-07-02T02:06:27.452299Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-02T12:34:16.033188Z","title":"BEVFormer: Learning Bird’s-Eye-View representation from multi-camera images via spatiotemporal transformers, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.03159","last_updated":"2026-07-23T22:35:14Z","snapshot_observed_at":"2026-08-02T12:34:11.019179Z","submitted_at":"2026-06-02T05:11:05Z","title":"NVIDIA OmniDreams: Real-Time Generative World Model for Closed-Loop Autonomous Vehicle Simulation","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T12:34:16.033188Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.03159"},"observation_digest":"sha256:26db54e6041c80f594ac46e94b5339a339c0d5e37399e990eee2e99110b26dcb","observation_id":"ac39401a-4851-47df-b270-f419b7319e87","resolution":{"observed_at":"2026-08-02T12:34:16.033188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2606.10303","last_updated":"2026-06-09T01:43:27Z","snapshot_observed_at":"2026-07-06T23:49:32.647742Z","submitted_at":"2026-06-09T01:43:27Z","title":"Isolation-aware Scheduling Framework for DNN-based End-to-End Autonomous Driving System on Tile-based Accelerators","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-27T11:49:46.697087Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.10303"},"observation_digest":"sha256:ff74b5edb8eb493765a635e8b20e50a2af8e5ef5daf48f15ecef4c94ccad8c81","observation_id":"11892c46-f107-46b5-9eda-0a28e3b81e72","resolution":{"observed_at":"2026-07-03T07:47:44.612320Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2606.13460","last_updated":"2026-08-06T16:08:38Z","snapshot_observed_at":"2026-08-08T07:14:18.345562Z","submitted_at":"2026-06-11T15:15:34Z","title":"VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-27T07:08:41.071757Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.13460"},"observation_digest":"sha256:04a2a7ce608f3e85f85e78d98e19dad9d7e2b75a5acdaff4c686ad3a15eae580","observation_id":"6f9966dc-0deb-4187-9a50-bc27b622f84c","resolution":{"observed_at":"2026-07-03T14:08:22.585056Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-15T10:49:28.959330Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.13460","last_updated":"2026-08-06T16:08:38Z","snapshot_observed_at":"2026-08-08T07:14:18.345562Z","submitted_at":"2026-06-11T15:15:34Z","title":"VISA: VLM-Guided Instance Semantic Auditing for 3D Occupancy World Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-15T10:49:28.959330Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.13460"},"observation_digest":"sha256:5090d240e547f47a4df90a99a8d21d8a9616f3fbb1ba40e136f5433878952c91","observation_id":"140ef37a-73d5-423c-b6f5-1f951345f183","resolution":{"observed_at":"2026-07-15T10:49:28.959330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":"2203.17270","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-03T14:08:22.583557Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"107ceb33-47b0-4f30-bab3-36a44b3c77e3","year":2022},"citing_paper":{"arxiv_id":"2606.27745","last_updated":"2026-07-15T13:11:28Z","snapshot_observed_at":"2026-08-06T21:48:03.348041Z","submitted_at":"2026-06-26T05:54:38Z","title":"Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-29T04:35:58.372801Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.27745"},"observation_digest":"sha256:fe2bd26822bd6d14cb8d5896f7106f9df9341cdbaacd33e15813b8730dbc0681","observation_id":"b4c6a4db-587d-4420-9252-6586c38d9d2d","resolution":{"observed_at":"2026-06-29T20:03:56.659347Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-02T09:58:51.929181Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.27745","last_updated":"2026-07-15T13:11:28Z","snapshot_observed_at":"2026-08-06T21:48:03.348041Z","submitted_at":"2026-06-26T05:54:38Z","title":"Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-02T09:58:51.929181Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2606.27745"},"observation_digest":"sha256:d9aef32612eb7948eb53b46a0473f32e2f13df03b8787333edc510fbaec431f0","observation_id":"01b31408-dafb-43ed-838e-739b059f9d83","resolution":{"observed_at":"2026-08-02T09:58:51.929181Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-07-11T23:42:57.473601Z","title":"arXiv preprint arXiv:2203.17270 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03822","last_updated":"2026-07-04T11:12:42Z","snapshot_observed_at":"2026-08-07T06:37:45.335496Z","submitted_at":"2026-07-04T11:12:42Z","title":"FDR-Occ: Factorized Dense Routing for Full-Spectrum 3D Occupancy Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T23:42:57.473601Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2607.03822"},"observation_digest":"sha256:c5b08f43cdf077216314dbacfa839191e7302e3d67ee3041d72bd48b78d633ce","observation_id":"2657712e-93b6-4f30-94bc-52cbdd4fbd41","resolution":{"observed_at":"2026-07-11T23:42:57.473601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-01T17:26:12.201838Z","title":"BEVFormer: Learning Bird’s-Eye-View Representation from Multi- Camera Images via Spatiotemporal Transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.17660","last_updated":"2026-07-20T08:10:58Z","snapshot_observed_at":"2026-08-07T23:01:55.655089Z","submitted_at":"2026-07-20T08:10:58Z","title":"RayOcc: Occlusion-Aware Ray Occupancy Estimation via Gaussian Mixture Intensity","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T17:26:12.201838Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2607.17660"},"observation_digest":"sha256:f27101576eef0571addf89d9819a465f7af739f58dd447b4812d25f78cf2fef2","observation_id":"b06769f7-8c62-460c-94c6-aad4a59852fa","resolution":{"observed_at":"2026-08-01T17:26:12.201838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2203.17270/citation-record","integrity":"/paper/2203.17270/integrity","json":"/paper/2203.17270/citation-record.json","paper":"/paper/2203.17270"},"outbound":[],"paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T12:55:23.720351Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 37 inbound Pith citation observations for arXiv:2203.17270."}