{"as_of":"2026-08-22T09:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:14c9ca2d5803c7c1e131c794a005b7a07cd9508a045307e2dc368632d3a09b0b","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:47:22.917452Z","state":"measured"},{"denominator":82,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":82,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.13147/citation-record","integrity":"/paper/2608.13147/integrity","json":"/paper/2608.13147/citation-record.json","paper":"/paper/2608.13147"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-08-17T05:59:48.347864Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-15T15:47:22.412910Z","title":"Beit: Bert pre-training of image transformers.arXiv preprint arXiv:2106.08254, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.412910Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:7de2f0a6a6f03adbdb816aa802b358bd68a6aa4f0435aa72707ee86d62fe922f","observation_id":"0cafc40d-6fbe-491f-80c4-aabe2da14921","resolution":{"observed_at":"2026-08-15T15:47:22.412910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.420820Z","title":"Must3r: Multi-view network for stereo 3d re- construction","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.420820Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:bc006e89a8c4b2263fde0645d8db2bd659ffc4eb0bde559659235a5a23508827","observation_id":"41d5d5c0-61a4-4caf-89d2-666892821114","resolution":{"observed_at":"2026-08-15T15:47:22.420820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.427419Z","title":"nuscenes: A mul- timodal dataset for autonomous driving","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.427419Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:e53cf0473a7a715f79852ba0deb3fdc41002cbba07640e1d5bd3def2461bfcfb","observation_id":"a6d13c95-4e8a-43fe-a498-4865b18ab1b7","resolution":{"observed_at":"2026-08-15T15:47:22.427419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.568462Z","title":"Pseudo-simulation for autonomous driv- ing","venue":null,"work_id":"bb0471ae-99e4-472a-97c7-f500cdd77158","year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.432953Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:e32f2f1f911c7b11dd2842d34fd017f44a78695e8c633e9ecef428484e2a278b","observation_id":"86255bc2-f431-4f90-b376-20f600f010f2","resolution":{"observed_at":"2026-08-15T15:47:24.574252Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.548032Z","title":"End-to-end object detection with transformers","venue":null,"work_id":"51892ab6-4b2d-42e0-9b40-b6d4e586c6cd","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.438781Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:cd401564789ec80f258e756fad2c90614bbccd6d5141cf9e96cceeace4ff163d","observation_id":"a7c2f75a-f1ec-44ef-bb19-64c708bb1922","resolution":{"observed_at":"2026-08-15T15:47:24.555868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.531004Z","title":"Emerging properties in self-supervised vision trans- formers","venue":null,"work_id":"c7b2c371-b0d6-4c0c-aa09-1d57e5249588","year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.444531Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:f9d0e10d204a096d864f82ff210f4074aec8a59f34906813e9b2f3f744bcd3b1","observation_id":"28b22cbe-ae43-42cc-bad7-58744a47b1b0","resolution":{"observed_at":"2026-08-15T15:47:24.535841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.513868Z","title":"A simple framework for contrastive learning of visual representations","venue":null,"work_id":"8d22d044-cfab-4931-a5c4-22d3acc608bc","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.451317Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:3351f114de468482b0080c677fe720f3618133e810b3657dc78be9f27a09e02b","observation_id":"c00a1332-b42c-4b62-8c43-57cfea928475","resolution":{"observed_at":"2026-08-15T15:47:24.519247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.495829Z","title":"Densebev: Transforming bev grid cells into 3d objects","venue":null,"work_id":"50ca1d30-9c0c-4e5d-a386-4e7a4dbf3ee0","year":2026},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.457902Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:48476d43cb689c6efa4d4d54e0d6581c5e1a222213c2d05e507074c951a142f8","observation_id":"9e5989f6-3a60-4e20-9560-677a50acea00","resolution":{"observed_at":"2026-08-15T15:47:24.502358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.475725Z","title":"Navsim: Data-driven non-reactive autonomous vehicle simulation and benchmarking.Advances in Neural Information Processing Systems, 37:28706–28719, 2024","venue":null,"work_id":"aaf65392-9af8-442a-874c-34f252baa086","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.463668Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:02c6e4a870f05528cda7acd8205e2849d810c3fecfe5deded624bfb7f98fabc9","observation_id":"2e728bf3-d75f-443b-b4cd-3591a2d30a6b","resolution":{"observed_at":"2026-08-15T15:47:24.482009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.469144Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.469144Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:87a3ae865523d8d7154ea16c2815cdc545241e9d2436247b5ef19d9332d8df83","observation_id":"355f62ce-d930-4c65-b419-1dee47fcab68","resolution":{"observed_at":"2026-08-15T15:47:22.469144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-15T15:47:22.474648Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.474648Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:d32c6836ef8268265d640494ed368614e84c0dd7b6043f39b10a27a8b5168f88","observation_id":"4b33c78a-9e33-4974-92ed-9a10030f494a","resolution":{"observed_at":"2026-08-15T15:47:22.474648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.444953Z","title":"Centernet: Keypoint triplets for object detection","venue":null,"work_id":"355c45ae-87f7-46b7-aafc-33ae6266873d","year":2019},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.479906Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:4a8674f3de8a4b0c9d8fb6b36b38e6cb2fd1d83a8087ca908dc69ea51ae7e252","observation_id":"b554c118-d1d0-4570-a462-aa88024ffbef","resolution":{"observed_at":"2026-08-15T15:47:24.451831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.427377Z","title":"Eva: Exploring the limits of masked visual rep- resentation learning at scale","venue":null,"work_id":"5c745f99-3612-40e9-aa5c-1f1cb31c9dbb","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.485498Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:86f6db7f0486cc870fa8dfc2feb754dca1c83ac50a6a990804a62c3be4971973","observation_id":"25c3c0fc-eee9-45be-b898-5f20d4799568","resolution":{"observed_at":"2026-08-15T15:47:24.433524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.409606Z","title":"Eva-02: A visual representation for neon genesis.Image and Vision Computing, 149: 105171, 2024","venue":null,"work_id":"82b523ef-e350-46bf-b6e5-50e430fdcb51","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.491089Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:cc0678343a81baf232c8eeb414e7eead8cdd1cf0c3ebc2f91bbeb12d86b730b5","observation_id":"c381453d-60f7-4398-bff7-86a10b70efac","resolution":{"observed_at":"2026-08-15T15:47:24.415666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.381899Z","title":"Vision meets robotics: The kitti dataset.The international journal of robotics research, 32(11): 1231–1237, 2013","venue":null,"work_id":"270dbb25-916d-473c-88e1-a121f6a74f0a","year":2013},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.496316Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:3a1beba1fea5f64b8ba089409972db72bdb0efc64ad853b36b86de702333b676","observation_id":"fb99d816-4121-4728-b49d-30b2064c2ef8","resolution":{"observed_at":"2026-08-15T15:47:24.389305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.361452Z","title":"Digging into self-supervised monocular depth estimation","venue":null,"work_id":"e8f95a8f-dc3c-44db-a6fe-dfc695ace43b","year":2019},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.501715Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:07f97399dbc07434fc424adbc1b73f16a3e683b58bd7461632124a5c95a9f4ff","observation_id":"c80c9f20-76cf-4328-918b-c525b6188a84","resolution":{"observed_at":"2026-08-15T15:47:24.367476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.507790Z","title":"3d packing for self-supervised monocular depth estimation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.507790Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:7c37075980d3e2378183544bfb4664048be07c20dcdc7492c17218c484959479","observation_id":"c75c953d-2af7-420d-a6c3-c6b9c7c3d6fe","resolution":{"observed_at":"2026-08-15T15:47:22.507790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.512998Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.512998Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:ed05989dc7a810b0435de60ac91cf3d87235683f70419a1dc8804ba82869bbf4","observation_id":"262d4780-60ce-46e3-bbb6-98b25bdcb6f0","resolution":{"observed_at":"2026-08-15T15:47:22.512998Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.323017Z","title":"Momentum con- trast for unsupervised visual representation learning","venue":null,"work_id":"2b8c552b-9631-436d-9ea6-a4c5b1eb80a7","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.519119Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:5ad601f766f17a5833ee38d38fcf083f0c3e9ee04edec67433f15738044e62c9","observation_id":"bd22f013-cee9-4016-9448-a704195a4839","resolution":{"observed_at":"2026-08-15T15:47:24.328110Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.524392Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.524392Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:60c5e8d0e42992e0981a7743ae02dba123e847e72d46468f7162775a5c19ab84","observation_id":"d0b41872-306d-4f87-a7c0-6c5e18c1cc72","resolution":{"observed_at":"2026-08-15T15:47:22.524392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-08-17T05:15:58.663240Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-15T15:47:22.529971Z","title":"Bevdet: High- performance multi-camera 3d object detection in bird-eye-view.arXiv preprint arXiv:2112.11790, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.529971Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:4a9d990b69ed294b4326ac73101b71b97f46cf4087b25e87835d330b64e7ee06","observation_id":"bf46dfac-b877-4ab4-ab0e-1b900395c414","resolution":{"observed_at":"2026-08-15T15:47:22.529971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.287533Z","title":"Tri- perspective view for vision-based 3d semantic occupancy prediction","venue":null,"work_id":"cfdb159d-68ba-4f9c-809d-73d43cc5cf23","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.535195Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:caa6eb81a99b621d64dcf4c5d95324b19fe3dd4046f47583354d5be81d744787","observation_id":"6e42d8da-bcc9-4165-88bb-e22579e11004","resolution":{"observed_at":"2026-08-15T15:47:24.294043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12643","last_updated":"2025-06-06T08:55:27Z","snapshot_observed_at":"2026-08-22T05:08:58.036751Z","submitted_at":"2025-04-17T05:05:31Z","title":"RoPETR: Improving Temporal Camera-Only 3D Detection by Integrating Enhanced Rotary Position Embedding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12643","snapshot_observed_at":"2026-08-15T15:47:22.541050Z","title":"Ropetr: Improving temporal camera-only 3d detection by integrating enhanced rotary position embedding.arXiv preprint arXiv:2504.12643, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.541050Z"},"links":{"cited_paper":"/paper/2504.12643","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:5e4ee4b1c8f3489bb9c69b4a83c8f87c87373778de462ae93192c68d19a08503","observation_id":"6feaab0d-b9aa-40d5-869a-666f6e2fb0f1","resolution":{"observed_at":"2026-08-15T15:47:22.541050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.547790Z","title":"Drivevggt: Visual geometry transformer for autonomous driving.arXiv preprint arXiv:2511.22264, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.547790Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:63d3510939cd73a70f656030b8e271cd74c33bc586b0edfea4b8bad980383afe","observation_id":"46e84c23-490c-48c8-b570-e26264eacf68","resolution":{"observed_at":"2026-08-15T15:47:22.547790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.262906Z","title":"Far3d: Expanding the horizon for surround-view 3d object detection","venue":null,"work_id":"0d68b31f-3a88-44ce-bd30-a910c3d930bf","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.554920Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:d0202319116ec4ddf539bd93290c4b52fda01214e0b9358cd9129ae6faa14d64","observation_id":"f8458b06-db24-4c07-ab62-4630cfe1173f","resolution":{"observed_at":"2026-08-15T15:47:24.271162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.244530Z","title":"Muon: An optimizer for hidden layers in neural networks, 2024","venue":null,"work_id":"8e4db43f-7b87-4285-b464-18e4b90ad1d9","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.561322Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:548f8bc4279e918d9cf6d28bebc0cd977a512e841c7f7cecab6b075bc012f732","observation_id":"9312d9aa-a533-4fed-a39a-22c500003c3d","resolution":{"observed_at":"2026-08-15T15:47:24.250403Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2509.13414","last_updated":"2026-01-23T18:59:33Z","snapshot_observed_at":"2026-08-17T16:28:17.444550Z","submitted_at":"2025-09-16T18:00:14Z","title":"MapAnything: Universal Feed-Forward Metric 3D Reconstruction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.13414","snapshot_observed_at":"2026-08-15T15:47:22.570981Z","title":"Mapanything: Universal feed-forward metric 3d reconstruction.arXiv preprint arXiv:2509.13414, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.570981Z"},"links":{"cited_paper":"/paper/2509.13414","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:ab6ce531212ba9c92a6f034b475ad48daccfc5ff4877b6a9ef5639b562505fcc","observation_id":"cbc6e8c1-89be-4bdd-a1d2-9a689717c0b9","resolution":{"observed_at":"2026-08-15T15:47:22.570981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.225982Z","title":"An energy and gpu-computation efficient backbone network for real-time object detection","venue":null,"work_id":"376ae820-2357-42e8-88fe-c490fd60c951","year":2019},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.578386Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:5dc2e094d83e7a6881d783a5992dd1519927ada4a260abed76c5de416acc2ea4","observation_id":"8f14dc23-2e3e-4d9e-b35b-9294659e2be0","resolution":{"observed_at":"2026-08-15T15:47:24.231024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.208186Z","title":"Grounding image matching in 3d with mast3r","venue":null,"work_id":"13ab413c-fcae-47de-93ee-779734fcf0e6","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.586293Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:ba9541600796c220f5f90a8c61bca8b94f8090ae4c90199ead8d3404dd2f47b1","observation_id":"5f326ae4-ee89-4bbe-b225-238a4f46713e","resolution":{"observed_at":"2026-08-15T15:47:24.214215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03105","last_updated":"2024-06-05T09:48:56Z","snapshot_observed_at":"2026-08-18T20:30:29.477789Z","submitted_at":"2024-06-05T09:48:56Z","title":"Enhancing 3D Lane Detection and Topology Reasoning with 2D Lane Priors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03105","snapshot_observed_at":"2026-08-15T15:47:22.593223Z","title":"En- hancing 3d lane detection and topology reasoning with 2d lane priors.arXiv preprint arXiv:2406.03105, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.593223Z"},"links":{"cited_paper":"/paper/2406.03105","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:0f612f7f055b019806f1b56cdeb91d5456a1bb2487d8b9fa342c6a851714dcc8","observation_id":"74334296-4591-42d9-81dc-940386bd2069","resolution":{"observed_at":"2026-08-15T15:47:22.593223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.189477Z","title":"Generalized focal loss: Learning qualified and distributed bounding boxes for dense object detection.Advances in neural information processing systems, 33: 21002–21012, 2020","venue":null,"work_id":"7a330892-4afb-4116-81c2-c3e92345216d","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.605296Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:3b9b0c12af87f49879447fd9e5be6ee76f7aa1d90a34a41fbd566df323704474","observation_id":"740fff3b-dfe7-4baa-aa11-904939b6013c","resolution":{"observed_at":"2026-08-15T15:47:24.195096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.170833Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detection","venue":null,"work_id":"21de7357-181a-476e-8695-8329b10dd0f9","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.610269Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:99dda5cdf6898329dc4732bcf3caf233f86724704d844b105866e62ad10a5d1f","observation_id":"b56f5190-b774-4d0e-a407-c5cc23acc3fa","resolution":{"observed_at":"2026-08-15T15:47:24.177140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01492","last_updated":"2023-07-04T05:55:54Z","snapshot_observed_at":"2026-08-20T11:45:00.774097Z","submitted_at":"2023-07-04T05:55:54Z","title":"FB-OCC: 3D Occupancy Prediction based on Forward-Backward View Transformation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.01492","snapshot_observed_at":"2026-08-15T15:47:22.616095Z","title":"Fb-occ: 3d occupancy prediction based on forward-backward view transformation.arXiv preprint arXiv:2307.01492, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.616095Z"},"links":{"cited_paper":"/paper/2307.01492","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:e333c6f2d152d8249706bc3af5d9523c9a63f9523e3a6155a353084efde7894c","observation_id":"1f2a9ded-4146-4e5b-a005-d5e5c0cf6001","resolution":{"observed_at":"2026-08-15T15:47:22.616095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.152066Z","title":null,"venue":null,"work_id":"8b0ffc2a-0dde-4ce2-aa72-ee721de50e83","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.621643Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:42f03033725f178f13a2867e90e9f63b5aee203be0ee81bf5e2e086cb1333f19","observation_id":"bbef3430-369d-4d9d-a2ad-93df3a0cdaa0","resolution":{"observed_at":"2026-08-15T15:47:24.157430Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.627063Z","title":"Focal loss for dense object detection","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.627063Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:a413c40c125817d91b12edc818de7fc00f9b52b510db353940390b49283160dd","observation_id":"d564ac4a-4e4b-40c3-912f-712605d70a27","resolution":{"observed_at":"2026-08-15T15:47:22.627063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.124885Z","title":"Ray denoising: Depth-aware hard negative sampling for multi-view 3d object detection","venue":null,"work_id":"3c03bed9-2daa-4388-9bb3-dac38ee04507","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.633349Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:a631a962f36e7234ec6513820e3684319bc2f20d43429ca062339a293b16b9d6","observation_id":"2b16c2a0-7719-409c-9448-40d5fe1c8258","resolution":{"observed_at":"2026-08-15T15:47:24.131444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.638042Z","title":"Fully sparse 3d occupancy prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.638042Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:89a2446b560d39c19830b10ca744f8fb47106ee16701cd693134d8f4348e48e7","observation_id":"25829b1a-b7e1-41c9-afde-19362cbaad0e","resolution":{"observed_at":"2026-08-15T15:47:22.638042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.094444Z","title":"Petr: Position embedding transformation for multi-view 3d object detection","venue":null,"work_id":"cbfb84cd-7b70-4f07-856a-1fbc2d119bea","year":2022},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.643181Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:69307e29c363f37627e1ce56520ef5ecb6f845fc1f58c0a059b47242e7e336ba","observation_id":"9ca4f16c-1102-4cdd-8c6b-77a5a67d02f3","resolution":{"observed_at":"2026-08-15T15:47:24.100546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.647984Z","title":"Petrv2: A unified framework for 3d perception from multi-camera images","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.647984Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:29aac4969bbae18b2f3123416a2d1672ad4d8154dc0046782576c10373bd7175","observation_id":"bd8270d9-eb22-40a5-be75-07ad5232d472","resolution":{"observed_at":"2026-08-15T15:47:22.647984Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.654761Z","title":"Swin transformer: Hierarchical vision transformer using shifted win- dows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.654761Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:0f8d346571dc046dd326fabdce609f3f3251318a8aee471f4ffbcecf1bd5e1b7","observation_id":"2638633b-230e-4fd3-95bd-dd1ecdbdca5a","resolution":{"observed_at":"2026-08-15T15:47:22.654761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.661675Z","title":"Bevfusion: Multi-task multi-sensor fusion with unified bird’s-eye view representation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.661675Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:7143163e4125f5b8ad99cdeb05cae7c0226e9358cb58bc06795320485c8de1a0","observation_id":"d1039bb8-4d48-42a7-a6ee-7a3dd0541574","resolution":{"observed_at":"2026-08-15T15:47:22.661675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.666729Z","title":"A convnet for the 2020s","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.666729Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:0d4079a520434491e92fa5b48810bbf85ea407e7371bee72a435765da5bb8c2d","observation_id":"40325213-cde6-4db0-abf0-0cae22fc35a7","resolution":{"observed_at":"2026-08-15T15:47:22.666729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1608.03983","last_updated":"2017-05-03T16:28:09Z","snapshot_observed_at":"2026-07-06T05:06:55.589962Z","submitted_at":"2016-08-13T13:46:05Z","title":"SGDR: Stochastic Gradient Descent with Warm Restarts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1608.03983","snapshot_observed_at":"2026-08-15T15:47:22.673415Z","title":"Sgdr: Stochastic gradient descent with warm restarts","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.673415Z"},"links":{"cited_paper":"/paper/1608.03983","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:3ad5fe4cf99a0514d3e9b797981112c406c47d0660d25b1b660567726fa2de77","observation_id":"b6e2180c-8ae2-435f-b73f-1d00baf2c438","resolution":{"observed_at":"2026-08-15T15:47:22.673415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T15:47:22.679330Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.679330Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:39e9fa562be0d219d7d3578abc0972c406c742771efe5695fa77dbf3f5da6728","observation_id":"a5aadb9c-8729-41d7-be7a-4cb106c76ce9","resolution":{"observed_at":"2026-08-15T15:47:22.679330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05959","last_updated":"2026-04-29T12:58:34Z","snapshot_observed_at":"2026-08-15T22:25:52.531646Z","submitted_at":"2026-03-06T06:44:17Z","title":"OVGGT: O(1) Constant-Cost Streaming Visual Geometry Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05959","snapshot_observed_at":"2026-08-15T15:47:22.684553Z","title":"Ovggt: O(1) constant-cost streaming visual geometry transformer.arXiv preprint arXiv:2603.05959, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.684553Z"},"links":{"cited_paper":"/paper/2603.05959","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:6917b885e2e050f6bf7466cdb896b4d225a42ee04fa2b8f730c78619ed9ae226","observation_id":"63b78576-a751-4399-b02e-dbbab20d09bd","resolution":{"observed_at":"2026-08-15T15:47:22.684553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-17T13:03:40.359628Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-15T15:47:22.691001Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.691001Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:3882c8ff4a563df4a23c639c4aa81e70ec2017ae7c2cc200e2d352226da61561","observation_id":"e214159e-ae8a-44d9-89cc-07d3b071d19a","resolution":{"observed_at":"2026-08-15T15:47:22.691001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:24.010278Z","title":"Is pseudo- lidar needed for monocular 3d object detection? InProceedings of the IEEE/CVF international conference on computer vision, pages 3142–3152, 2021","venue":null,"work_id":"4169e90e-87eb-417a-b780-936633ec19d2","year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.696905Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:871b71e8efa95db2ace79e36ff7d5834fd2395628f3c24e92038a4e4f9e52427","observation_id":"f1c0bc71-d9ee-469b-8082-3919e94be1ca","resolution":{"observed_at":"2026-08-15T15:47:24.018229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.983762Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unprojecting to 3d","venue":null,"work_id":"dbe60ddd-a755-4471-a826-116aaa666ca3","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.702703Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:a8968cfda20e0cf390ea99de00b390c1d2bcaab991195fb455573e3ea9193f7d","observation_id":"b493eb45-204d-42eb-a83a-7f14add6b752","resolution":{"observed_at":"2026-08-15T15:47:23.992431Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.710023Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.710023Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:62f43ee60ee51a3ce48705556fa50217406b36d865a265d185ddc42d8579e345","observation_id":"aa6bb332-c58a-4882-82f5-485fbd9f6c1a","resolution":{"observed_at":"2026-08-15T15:47:22.710023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.715745Z","title":"Vision transformers for dense prediction","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.715745Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:9b2046027c5c0961f5a12a720b44a76efbc651acea78e2ddff6bd08c44b32a97","observation_id":"fc2a94b9-15a0-4c09-978c-47ee22f3bc1d","resolution":{"observed_at":"2026-08-15T15:47:22.715745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.942676Z","title":"Superglue: Learning feature matching with graph neural networks","venue":null,"work_id":"0d8825b9-26d3-4e0c-baec-2a6c7f818a1d","year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.720710Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:46e1424bd52a24e14cc0ac4290c701c683312da5a97d22c9f36e224c2270d73a","observation_id":"9a30f4b7-6da2-4037-af2c-61ae689f5fbf","resolution":{"observed_at":"2026-08-15T15:47:23.948161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.727684Z","title":"Structure-from-motion revisited","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.727684Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:0e08dd0f7327d3d27514e988e9a2839d3ed3408eb15046e71ba453e30dfb2d60","observation_id":"0b7b383a-171f-4d59-8e4c-8e3c0891ce8e","resolution":{"observed_at":"2026-08-15T15:47:22.727684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.02560","last_updated":"2025-11-09T15:12:33Z","snapshot_observed_at":"2026-08-14T20:43:48.309995Z","submitted_at":"2025-09-02T17:54:21Z","title":"FastVGGT: Training-Free Acceleration of Visual Geometry Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.02560","snapshot_observed_at":"2026-08-15T15:47:22.733429Z","title":"Fastvggt: Training-free acceleration of visual geometry transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.733429Z"},"links":{"cited_paper":"/paper/2509.02560","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:2d3ad7c928cf6ad866aac72263a00a4ca3583c029360f28c0f4547bcd80c49bd","observation_id":"4f4f8449-32f7-4341-8ca3-9ee715da6bf3","resolution":{"observed_at":"2026-08-15T15:47:22.733429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.915519Z","title":"3dppe: 3d point positional encoding for transformer-based multi-camera 3d object detection","venue":null,"work_id":"2d222af8-11e3-4fe9-9518-f466d6b490ae","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.738946Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:815c0fe81b8f4fd105b58d44ccab5b1a5116f0c616d900c2dcd540faf872a545","observation_id":"1cb56e57-c869-438a-b34d-b8a16c31accf","resolution":{"observed_at":"2026-08-15T15:47:23.920447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10104","last_updated":"2025-08-13T18:00:55Z","snapshot_observed_at":"2026-08-18T01:07:23.737664Z","submitted_at":"2025-08-13T18:00:55Z","title":"DINOv3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10104","snapshot_observed_at":"2026-08-15T15:47:22.744184Z","title":"Dinov3.arXiv preprint arXiv:2508.10104, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.744184Z"},"links":{"cited_paper":"/paper/2508.10104","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:8c121e33728c6920e694d8d8f350aa619b76f96740cb58da7d848e23c3d5a296","observation_id":"fb755340-e89c-436e-88a5-ac75f84c7d83","resolution":{"observed_at":"2026-08-15T15:47:22.744184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.895919Z","title":"Light field networks: Neural scene representations with single-evaluation render- ing.Advances in Neural Information Processing Systems, 34:19313–19325, 2021","venue":null,"work_id":"02547058-7a6a-48fe-8541-e101b74dfb3e","year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.750056Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:72c01bf53f36134b5b8de2582eddeeac1d7df95270cd23e1bfee944b32df2cb2","observation_id":"bc0248bf-5e1c-4086-9d2d-7131935226f1","resolution":{"observed_at":"2026-08-15T15:47:23.902770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.877953Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"c213c2ab-5263-4c30-a8ce-2d7229babde2","year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.756637Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:cd1ee817a6885cc3cd34f52c52fe8611463f45f459c9a14f018b65b74b0a5c64","observation_id":"07e9382a-706a-4527-a143-13b806e463c2","resolution":{"observed_at":"2026-08-15T15:47:23.884898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.762283Z","title":"Scalability in perception for autonomous driving: Waymo open dataset","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.762283Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:36ce97d2b5468437307afcf0022b1d2565cc382ce8fcdab6d31714d894b25587","observation_id":"032e93d5-9a5a-4720-b73d-6f2168801ddd","resolution":{"observed_at":"2026-08-15T15:47:22.762283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.842257Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for autonomous driving.Advances in Neural Information Processing Systems, 36:64318– 64330, 2023","venue":null,"work_id":"520ca9ca-06eb-442a-9f85-d8b39230c8e4","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.770854Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:8de0511fdd691aeb32dfffa434ac144784e02aeec32d094fc2822b26c5bd1c52","observation_id":"8a9a38ca-fe91-4d93-b2a6-540005c747fe","resolution":{"observed_at":"2026-08-15T15:47:23.848742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.820876Z","title":"Patchmatchnet: Learned multi-view patchmatch stereo","venue":null,"work_id":"b9afeba0-c607-49ad-bcc4-9d7d38730e03","year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.777216Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:ff2475cb657ab94ea0674077dfba01ec8015c01abcda49d67ad6a81602b5d2a6","observation_id":"b008c9bc-9886-4ceb-97ef-68843b7637dc","resolution":{"observed_at":"2026-08-15T15:47:23.827354Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.794910Z","title":"Opus: occupancy prediction using a sparse set","venue":null,"work_id":"263416b9-2f42-4b06-a5ec-4c99282082d5","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.782479Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:7c77b095168d2bfcb6efe965f503aade8972d01ab2622217a60ce1998957d2e0","observation_id":"6913f5bf-774b-4c01-befc-8b8394b26c42","resolution":{"observed_at":"2026-08-15T15:47:23.803446Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.756461Z","title":"Vggsfm: Vi- sual geometry grounded deep structure from motion","venue":null,"work_id":"da0c7b53-d14a-4d66-aa4b-d2ab6e490246","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.787485Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:4ec649614c3dedf8ac2e1dc5897ff28ec09f70bf4cd88125d5ac70175d5a2b33","observation_id":"28edf36a-8206-4d9a-acd8-3fd3e4b65444","resolution":{"observed_at":"2026-08-15T15:47:23.771298Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.737857Z","title":"Vggt: Visual geometry grounded transformer","venue":null,"work_id":"b4521658-88fe-4c44-8f24-fe660e818bfd","year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.792515Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:6920c9f0f6bdfb78871f111006d5eaa4438341eedaa503e94131ee66ab33b7d6","observation_id":"d56eebaf-ff2b-4f2b-b04b-ec62a48a9ee5","resolution":{"observed_at":"2026-08-15T15:47:23.744463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.715174Z","title":"Exploring object-centric temporal modeling for efficient multi-view 3d object detection","venue":null,"work_id":"f503212e-10b4-45ed-bbe1-63cca7986e1e","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.799457Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:cb691ea446d116b8a69d121a2c203d25a0a2d5881a5d0605d3dc5cf2487933f7","observation_id":"f586d193-6001-4ad2-8743-1b8446f6a453","resolution":{"observed_at":"2026-08-15T15:47:23.722853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.804454Z","title":"Dust3r: Geometric 3d vision made easy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.804454Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:ace7c05848bdbdfaf08e603cb76eb9939a61c31e710d57ae1f3eca28a241b510","observation_id":"ccba9d52-0101-4a7c-ad38-5941a5b4b6b0","resolution":{"observed_at":"2026-08-15T15:47:22.804454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.672997Z","title":"Fcos3d: Fully convolutional one-stage monocular 3d object detection","venue":null,"work_id":"3ed0b6cc-8bc4-496e-9d03-62a2fa967869","year":2021},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.809238Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:a319eab38e0ae0fb5f1af4b6afdf5900a27b974d4bb638a0cf938d035ca19328","observation_id":"b39a9fea-d666-4c27-b4bd-b0ec038342df","resolution":{"observed_at":"2026-08-15T15:47:23.680203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12716","last_updated":"2022-07-26T08:10:29Z","snapshot_observed_at":"2026-08-21T05:55:35.212105Z","submitted_at":"2022-07-26T08:10:29Z","title":"MV-FCOS3D++: Multi-View Camera-Only 4D Object Detection with Pretrained Monocular Backbones","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.12716","snapshot_observed_at":"2026-08-15T15:47:22.815201Z","title":"Mv-fcos3d++: Multi-view camera-only 4d object detection with pretrained monocular backbones","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.815201Z"},"links":{"cited_paper":"/paper/2207.12716","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:1e4c39534550d7243b2d51f41a2cc17a8041cd241914adb8510d1c5cf3db7dc9","observation_id":"6ad5e223-362e-4d90-ae71-6fd19cbae635","resolution":{"observed_at":"2026-08-15T15:47:22.815201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.13347","last_updated":"2026-03-07T07:01:59Z","snapshot_observed_at":"2026-08-18T07:52:03.034005Z","submitted_at":"2025-07-17T17:59:53Z","title":"$\\pi^3$: Permutation-Equivariant Visual Geometry Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.13347","snapshot_observed_at":"2026-08-15T15:47:22.821420Z","title":"XUet al.: GEOMETRY -GROUNDED UNIFIED 3D PERCEPTION21","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.821420Z"},"links":{"cited_paper":"/paper/2507.13347","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:e9b61606c76bfa10274f225c2b7f0ce8c9c31393f48b3e4f7bddde59aa2cabf2","observation_id":"b4ffea66-7389-4b91-9951-2de8806db9d2","resolution":{"observed_at":"2026-08-15T15:47:22.821420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.652910Z","title":"Detr3d: 3d object detection from multi-view images via 3d-to-2d queries","venue":null,"work_id":"6af711d1-ae2e-4176-942e-387901675f88","year":2022},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.828727Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:d3ab7c06922ebd92352e22c425757b9a07a8a38c46d0e9634869409d1ab2b94c","observation_id":"f60d37aa-5c59-44e3-bbca-b6618f34ec0a","resolution":{"observed_at":"2026-08-15T15:47:23.658322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.634823Z","title":"Object as query: Lifting any 2d object detector to 3d detection","venue":null,"work_id":"d07d27cc-81f0-408f-8a91-e61beed10ed2","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.834904Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:91d36ac57bd3e882f698102389f7919afd9d00ac8709e6bd9a753347d00f05c6","observation_id":"76fc9963-cfb3-4876-b448-dfeaac804f7b","resolution":{"observed_at":"2026-08-15T15:47:23.640343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.617966Z","title":"Sur- roundocc: Multi-camera 3d occupancy prediction for autonomous driving","venue":null,"work_id":"be985a6f-103b-467e-ba19-b4ff7665af2c","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.839790Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:d639d6b7613bf6222ef5587be4a2064fc1e3f02ba8adb0f84c4d6cd23f44f3cd","observation_id":"91c1fbfe-2e34-40e4-bfbf-0cb2409f48dd","resolution":{"observed_at":"2026-08-15T15:47:23.623530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00493","last_updated":"2023-01-02T00:36:22Z","snapshot_observed_at":"2026-08-12T21:55:36.747659Z","submitted_at":"2023-01-02T00:36:22Z","title":"Argoverse 2: Next Generation Datasets for Self-Driving Perception and Forecasting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00493","snapshot_observed_at":"2026-08-15T15:47:22.846692Z","title":"Argoverse 2: Next generation datasets for self-driving perception and forecasting.arXiv preprint arXiv:2301.00493, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.846692Z"},"links":{"cited_paper":"/paper/2301.00493","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:2e1e1a0bf1bd34f3c986d503359205b8b0836a7b7046bc4013770947952a7a6d","observation_id":"3c42377f-93d7-445a-a2c7-3be5fe7aa232","resolution":{"observed_at":"2026-08-15T15:47:22.846692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.596645Z","title":"Bevformer v2: Adapting mod- ern image backbones to bird’s-eye-view recognition via perspective supervision","venue":null,"work_id":"a75b9a6c-24af-434f-97b3-68d275f65882","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.854515Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:6937a2321c24f30a20befae8ef0792a24be57e7a292b89dfc2a5c6ae356b22aa","observation_id":"08d37083-7705-4312-9d42-1819a39b5f29","resolution":{"observed_at":"2026-08-15T15:47:23.604533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.579739Z","title":"Depth anything: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"1afd8e85-ec41-45d0-bd8b-df662c2de341","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.862129Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:06b41dead7f2283b74868e9331ac3d49cf93a83ca91a2e0ccb4fc1d3530143ec","observation_id":"f3ee04ac-fa06-4880-bd06-4f6b2b7440f1","resolution":{"observed_at":"2026-08-15T15:47:23.584930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.558459Z","title":"Drivesuprim: Towards precise trajectory selection for end-to-end plan- ning","venue":null,"work_id":"13f9fc03-8088-4d34-ba03-b1733ef538d6","year":2026},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.868247Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:1dba8085bb35d48ad847cfe81bced73589f30933b5bbfe04dd09c6f5241d796c","observation_id":"e43755a5-5f4f-4e20-8a60-b2db0ebbfdb7","resolution":{"observed_at":"2026-08-15T15:47:23.565665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.874224Z","title":"Mvsnet: Depth inference for unstructured multi-view stereo","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.874224Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:2a0e631c863f244085e131be01ad0540c4c77062b046103c4dd9c38b19738716","observation_id":"716b1357-6c12-4910-9dc4-d8f3ebe131d8","resolution":{"observed_at":"2026-08-15T15:47:22.874224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:22.879359Z","title":"Infinitevggt: Visual geometry grounded transformer for endless streams.arXiv preprint arXiv:2601.02281, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.879359Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:25e342360d5d263919ec76cb06f57f989c57ff92c6ae2df8ad5fb5a85afa5ed0","observation_id":"111c9f02-9478-4238-bb13-06d1d3be7334","resolution":{"observed_at":"2026-08-15T15:47:22.879359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.522120Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"6af4ad07-a0fb-46d3-94cd-f18d1dbb4cc5","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.886097Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:aa11f9b721e178974d42d2414ff62532d847027ff4a54ef6f6870a5208dbce5c","observation_id":"b0a83956-9e94-4bf8-aca2-3522126252dd","resolution":{"observed_at":"2026-08-15T15:47:23.527332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.502231Z","title":"Occformer: Dual-path transformer for vision-based 3d semantic occupancy prediction","venue":null,"work_id":"d9ec36c5-1306-4705-a2ce-ccaff6f9f92a","year":2023},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.895842Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:ae4b2cd4dcfd8edff38f1936f81d8491d0d6c3f16d509662a3c8a370a3b6b2f7","observation_id":"ec6518d1-a1b6-4dcd-a90c-d0d67ba15b4f","resolution":{"observed_at":"2026-08-15T15:47:23.507751Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T15:47:23.481454Z","title":"Free3d: Consistent novel view synthesis without 3d representation","venue":null,"work_id":"85c6e090-638e-4683-b1bd-cb9f7751e9e7","year":2024},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.905630Z"},"links":{"citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:7b3c1d768ef99d53f37063cf4fe05e16fdfb25373ca1b0c3d30cdce4fcaa0e2b","observation_id":"7e59bfe3-a91e-469d-bf93-568a6b40d842","resolution":{"observed_at":"2026-08-15T15:47:23.488473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.11539","last_updated":"2026-03-31T10:04:45Z","snapshot_observed_at":"2026-08-21T19:45:07.307576Z","submitted_at":"2025-07-15T17:59:57Z","title":"Streaming 4D Visual Geometry Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11539","snapshot_observed_at":"2026-08-15T15:47:22.911834Z","title":"Streaming 4d visual geometry transformer.arXiv preprint arXiv:2507.11539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.911834Z"},"links":{"cited_paper":"/paper/2507.11539","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:0ef9dd5fe732c195c250daba2f94e593b0e163193861fd5b872a7a740223b648","observation_id":"f4b0028b-2203-466f-88e6-87c2e9419b54","resolution":{"observed_at":"2026-08-15T15:47:22.911834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.16919","last_updated":"2026-06-03T07:14:50Z","snapshot_observed_at":"2026-08-12T21:06:01.868549Z","submitted_at":"2025-12-18T18:59:57Z","title":"DVGT: Driving Visual Geometry Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.16919","snapshot_observed_at":"2026-08-15T15:47:22.917452Z","title":"Dvgt: Driving visual geometry transformer","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-15T15:47:22.917452Z"},"links":{"cited_paper":"/paper/2512.16919","citing_paper":"/paper/2608.13147"},"observation_digest":"sha256:6ca2f50c5d43863e3e7865ea16536e6f5616afd5aef3e75c5f0ef26a30bb12ee","observation_id":"09c35a0b-9316-4d5b-a01d-f5c7bd281f86","resolution":{"observed_at":"2026-08-15T15:47:22.917452Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.13147","last_updated":"2026-08-13T12:17:50Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-19T00:54:40.079550Z","submitted_at":"2026-08-13T12:17:50Z","title":"Geometry-Grounded Unified 3D Perception for Autonomous Driving"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":38,"verified_exact":0,"verified_fuzzy":43},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 0 inbound Pith citation observations for arXiv:2608.13147."}