{"as_of":"2026-08-08T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:13daffbe551549431727e2ca15845a6255ee6b380d189931974c1c8e0fc9af50","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:10:19.700130Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.20963/citation-record","integrity":"/paper/2507.20963/integrity","json":"/paper/2507.20963/citation-record.json","paper":"/paper/2507.20963"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.563916Z","title":"Cross-view transformers for real-time map-view semantic segmentation,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.563916Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:a08d6ddf264b174a9240cff605f668fe59fe944d50f7379a61510d99be37d511","observation_id":"c7374141-010a-498b-9f80-ffa1faf65283","resolution":{"observed_at":"2026-08-06T13:10:19.563916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.097026Z","title":"Lidar panoptic segmentation for autonomous driving,","venue":null,"work_id":"6ffe08c0-9ff9-4125-a80a-9922106dd722","year":2020},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.567778Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:35d42d12d78d98b4798b76f52576dc56bacc068c029df127b3e893cb91307552","observation_id":"1dfa4372-0044-43bb-ab68-fda120be3e9f","resolution":{"observed_at":"2026-08-06T13:10:20.100341Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.087084Z","title":"Fiery: future instance prediction in bird’s- eye view from surround monocular cameras,","venue":null,"work_id":"e5cc7701-9b92-4f96-9067-73c827318307","year":2021},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.570850Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:98a02b3c996ef9d01cf0ce8ae168ae3b5560663d4710e6c072ab980f94e9adea","observation_id":"3fe4e7c4-d2c1-45ea-b39c-afb2e5e336d3","resolution":{"observed_at":"2026-08-06T13:10:20.090627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.077570Z","title":"Is pseudo- lidar needed for monocular 3d object detection?","venue":null,"work_id":"9ba59cd4-95a7-4b37-8353-34e386e06211","year":2021},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.574043Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:bbee0ad1d66631ed9793c33c062b100cf488a60eba23cf90bdb5c9761b2b0994","observation_id":"b01364aa-ee59-49fd-b97a-81ecd8486927","resolution":{"observed_at":"2026-08-06T13:10:20.080767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.577176Z","title":"MMDetection3D: OpenMMLab next-generation platform for general 3D object detection,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.577176Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:ffd6d80ae827feae85fa500c7b95305b8322be7a1419bcdc384816628707bf1e","observation_id":"25df734d-e7c0-4289-80f9-b43f9842e40a","resolution":{"observed_at":"2026-08-06T13:10:19.577176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.14437","last_updated":"2023-01-30T02:39:49Z","snapshot_observed_at":"2026-07-06T13:47:00.653824Z","submitted_at":"2022-08-30T17:55:59Z","title":"MapTR: Structured Modeling and Learning for Online Vectorized HD Map Construction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.14437","snapshot_observed_at":"2026-08-06T13:10:19.580503Z","title":"Maptr: Structured modeling and learning for online vectorized hd map construction,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.580503Z"},"links":{"cited_paper":"/paper/2208.14437","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:7db78511432de87d33acce12f991706abde358d945dc0557c7025f1dca302250","observation_id":"1e90ecda-84f2-4068-85b6-8d561276a44d","resolution":{"observed_at":"2026-08-06T13:10:19.580503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.060339Z","title":"Predicting semantic map representations from images using pyramid occupancy networks,","venue":null,"work_id":"8347fd9f-d1f6-4e5e-9561-e7def81e90e2","year":2020},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.585220Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:1cf5539b491dfe8a5fd596372ad47e594923557bf3f912620a771ad1ce15f8bc","observation_id":"57f79c23-dccd-47de-b1aa-632fee207775","resolution":{"observed_at":"2026-08-06T13:10:20.063746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.14201","last_updated":"2022-09-28T16:19:06Z","snapshot_observed_at":"2026-07-06T13:57:20.787191Z","submitted_at":"2022-09-28T16:19:06Z","title":"Spatial Pruned Sparse Convolution for Efficient 3D Object Detection","version":1},"cited_work":{"arxiv_id":"2209.14201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.14201","snapshot_observed_at":"2026-08-06T13:10:19.905514Z","title":"Spatial Pruned Sparse Convolution for Efficient 3D Object Detection","venue":"cs.CV","work_id":"a79506ab-2e88-4a30-9fa2-df7ee7ff6638","year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.588299Z"},"links":{"cited_paper":"/paper/2209.14201","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:55179f0c49f5a1e0049f1dd3525ee559f4e3d12f70732553fa654b477a7a4f83","observation_id":"1288bc51-55a3-47cd-bc17-8d3222143c95","resolution":{"observed_at":"2026-08-06T13:10:19.910765Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.049706Z","title":"Multi- scale interaction for real-time lidar data segmentation on an embedded platform,","venue":null,"work_id":"7ef142b1-0cac-4813-90e1-801c3dbb56fd","year":2021},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.591322Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:7ff6f055b2bad5327a866e4bd120aa553e56536254f5fb2aacddfb3cbbc23f2c","observation_id":"0531a00b-8dfe-4666-8def-4c624ecf95dd","resolution":{"observed_at":"2026-08-06T13:10:20.053719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13540","last_updated":"2023-02-27T06:35:03Z","snapshot_observed_at":"2026-08-04T09:40:33.174673Z","submitted_at":"2023-02-27T06:35:03Z","title":"OccDepth: A Depth-Aware Method for 3D Semantic Scene Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13540","snapshot_observed_at":"2026-08-06T13:10:19.594413Z","title":"Occdepth: A depth-aware method for 3d semantic scene completion,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.594413Z"},"links":{"cited_paper":"/paper/2302.13540","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:a16941afc6e24d40b8645f4a3b4b41d5041118723afc575f06661877fc7f6b87","observation_id":"a7f60da8-91ab-436c-8eff-27b18bf49b9b","resolution":{"observed_at":"2026-08-06T13:10:19.594413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07817","last_updated":"2023-03-02T16:41:45Z","snapshot_observed_at":"2026-07-06T14:52:11.722960Z","submitted_at":"2023-02-15T17:58:10Z","title":"Tri-Perspective View for Vision-Based 3D Semantic Occupancy Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07817","snapshot_observed_at":"2026-08-06T13:10:19.597569Z","title":"Tri-perspective view for vision-based 3d semantic occupancy prediction,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.597569Z"},"links":{"cited_paper":"/paper/2302.07817","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:c550f73454bbdaf3c80008d034d0304520e62a16eb9d9ea86a7b159c992b285c","observation_id":"31b5f350-4b0e-4f5c-bb66-a245ab55f5e6","resolution":{"observed_at":"2026-08-06T13:10:19.597569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03991","last_updated":"2023-03-07T15:43:39Z","snapshot_observed_at":"2026-07-06T14:59:46.707335Z","submitted_at":"2023-03-07T15:43:39Z","title":"OpenOccupancy: A Large Scale Benchmark for Surrounding Semantic Occupancy Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03991","snapshot_observed_at":"2026-08-06T13:10:19.600685Z","title":"Openoccupancy: A large scale benchmark for surround- ing semantic occupancy perception,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.600685Z"},"links":{"cited_paper":"/paper/2303.03991","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:175380871c45f6fb46ef061ed4c79cd4dc6327d03cf60d2133922d3c00b1338d","observation_id":"1d2b38f5-756f-4ea2-ad60-2814fdb36b5a","resolution":{"observed_at":"2026-08-06T13:10:19.600685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.039375Z","title":"V oxformer: Sparse voxel transformer for camera- based 3d semantic scene completion,","venue":null,"work_id":"2f95a426-34fd-4279-8276-812d34a24b8c","year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.603874Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:452b2416cd96737786516830bfae9d9d4f16040d2d6f89beccc83ab6a0f0ec69","observation_id":"56a68fa4-b16e-470b-a27e-f3d8c920d688","resolution":{"observed_at":"2026-08-06T13:10:20.042611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.607735Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.607735Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:4407f1fcff3a2d5893f24fcb5c6a4f30a780b87707c9458571a382ad184923e6","observation_id":"439806da-d21c-403e-89ca-8ea495261a99","resolution":{"observed_at":"2026-08-06T13:10:19.607735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07587","last_updated":"2024-10-08T11:07:08Z","snapshot_observed_at":"2026-08-05T16:35:01.719928Z","submitted_at":"2024-07-10T12:20:11Z","title":"Let Occ Flow: Self-Supervised 3D Occupancy Flow Prediction","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07587","snapshot_observed_at":"2026-08-06T13:10:19.610656Z","title":"Let occ flow: Self-supervised 3d occupancy flow prediction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.610656Z"},"links":{"cited_paper":"/paper/2407.07587","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:f3488793e048713249d57c6ccefd656adb433b1f0df1a005451fbbf8607bfb31","observation_id":"67590b7a-4b4d-4e37-bf6c-26cd78b0ff9b","resolution":{"observed_at":"2026-08-06T13:10:19.610656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.022434Z","title":"Panoocc: Unified occupancy representation for camera-based 3d panoptic segmentation,","venue":null,"work_id":"8db9bb1e-ec77-455d-9ec5-1eced0af48b1","year":null},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.614448Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:367f6ff0cf9123b22d11e0b3f7e48c64d51ab81983be25b93ca86eb2fa537753","observation_id":"4e830e7d-fe74-4173-b551-e1aba64cd519","resolution":{"observed_at":"2026-08-06T13:10:20.025852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02517","last_updated":"2024-09-18T06:33:32Z","snapshot_observed_at":"2026-08-02T00:17:39.810357Z","submitted_at":"2024-04-03T07:10:18Z","title":"HENet: Hybrid Encoding for End-to-end Multi-task 3D Perception from Multi-view Cameras","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02517","snapshot_observed_at":"2026-08-06T13:10:19.620413Z","title":"Henet: Hybrid encoding for end-to-end multi-task 3d perception from multi-view cameras,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.620413Z"},"links":{"cited_paper":"/paper/2404.02517","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:1d6f589e51125d524c1bf1afc9147e98b1b390e0c997443a8fe1b748d7a5343a","observation_id":"d4d5604d-1b5c-4f61-a7c4-2c311c304f67","resolution":{"observed_at":"2026-08-06T13:10:19.620413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17054","last_updated":"2022-06-16T09:44:08Z","snapshot_observed_at":"2026-07-06T12:55:16.868412Z","submitted_at":"2022-03-31T14:21:19Z","title":"BEVDet4D: Exploit Temporal Cues in Multi-camera 3D Object Detection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17054","snapshot_observed_at":"2026-08-06T13:10:19.623400Z","title":"Bevdet4d: Exploit temporal cues in multi-camera 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.623400Z"},"links":{"cited_paper":"/paper/2203.17054","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:72138b2e9a1876ff5a7f4042ff1dad04932345003fd299bf863ee2d58959c10a","observation_id":"c1a9020e-40b5-4820-a9cc-0f5bae69602c","resolution":{"observed_at":"2026-08-06T13:10:19.623400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11239","last_updated":"2020-12-16T21:15:05Z","snapshot_observed_at":"2026-07-06T09:30:47.469703Z","submitted_at":"2020-06-19T17:24:44Z","title":"Denoising Diffusion Probabilistic Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11239","snapshot_observed_at":"2026-08-06T13:10:19.629792Z","title":"Denoising diffusion probabilistic models,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.629792Z"},"links":{"cited_paper":"/paper/2006.11239","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:81a2e0a27429dcd09d74d5b95adc08a18c4c605066522233c7e6106c67bfa7df","observation_id":"258ef602-6e01-4852-b133-2f98b7494ce5","resolution":{"observed_at":"2026-08-06T13:10:19.629792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02467","last_updated":"2025-01-05T07:28:50Z","snapshot_observed_at":"2026-08-07T00:12:51.933932Z","submitted_at":"2025-01-05T07:28:50Z","title":"DeTrack: In-model Latent Denoising Learning for Visual Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02467","snapshot_observed_at":"2026-08-06T13:10:19.632615Z","title":"Detrack: In-model latent denoising learning for visual object tracking,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.632615Z"},"links":{"cited_paper":"/paper/2501.02467","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:37a82b16b7d909a096e4b910a809454242c5aed0b450a3a0c07cba5749a29b12","observation_id":"53445377-b1ec-417e-9c52-9c638e96e9cb","resolution":{"observed_at":"2026-08-06T13:10:19.632615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14365","last_updated":"2023-12-13T17:41:17Z","snapshot_observed_at":"2026-07-06T15:20:53.397829Z","submitted_at":"2023-04-27T17:40:08Z","title":"Occ3D: A Large-Scale 3D Occupancy Prediction Benchmark for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14365","snapshot_observed_at":"2026-08-06T13:10:19.636072Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.636072Z"},"links":{"cited_paper":"/paper/2304.14365","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:c7599db66e64fd6ca349e9fb09dd7a448a5fbbecaeb12621505da614c0ca15cf","observation_id":"1e82a5dc-f235-400c-bcc9-f27077a3514e","resolution":{"observed_at":"2026-08-06T13:10:19.636072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:20.011296Z","title":"Monoscene: Monocular 3d semantic scene completion,","venue":null,"work_id":"ffd71874-e53b-4fe5-acfb-700fb20119c2","year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.639272Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:e8d1aa1722cfb87e32a4c861725a7324230d936217daf29b05092efce85f9fc5","observation_id":"a03adaa1-9580-44d6-8642-8d520feb71f1","resolution":{"observed_at":"2026-08-06T13:10:20.014767Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.04159","last_updated":"2021-03-18T03:14:26Z","snapshot_observed_at":"2026-07-06T10:02:45.105181Z","submitted_at":"2020-10-08T17:59:21Z","title":"Deformable DETR: Deformable Transformers for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.04159","snapshot_observed_at":"2026-08-06T13:10:19.642327Z","title":"Deformable detr: Deformable transformers for end-to-end object detection,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.642327Z"},"links":{"cited_paper":"/paper/2010.04159","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:84baff3bb6ac1e56d86a9f3923f8fb7a2b994f63be191407c61712ac6676f9a8","observation_id":"c7dd359f-694c-4c90-9b1e-fbfabddeea96","resolution":{"observed_at":"2026-08-06T13:10:19.642327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.08318","last_updated":"2021-11-16T09:22:15Z","snapshot_observed_at":"2026-07-06T12:08:57.241574Z","submitted_at":"2021-11-16T09:22:15Z","title":"DRINet++: Efficient Voxel-as-point Point Cloud Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.08318","snapshot_observed_at":"2026-08-06T13:10:19.645769Z","title":"Drinet++: Ef- ficient voxel-as-point point cloud segmentation,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.645769Z"},"links":{"cited_paper":"/paper/2111.08318","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:61ddd367557b6ee8fc11497210a24fac2f66f31627756e630aa16c9f9e1c9b8e","observation_id":"6f7e6e98-e4a8-41fd-8f72-11a176c101e2","resolution":{"observed_at":"2026-08-06T13:10:19.645769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.649487Z","title":"Search- ing efficient 3d architectures with sparse point-voxel convolution,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.649487Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:1c59c8b78043a88280a8dcfebb65556027ccc11f2138bcc70e44ed22ac70e82d","observation_id":"cf0aba89-01e4-4ef1-9e61-9408acfecdd3","resolution":{"observed_at":"2026-08-06T13:10:19.649487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.994727Z","title":"Deepvoxels: Learning persistent 3d feature embeddings,","venue":null,"work_id":"5e8d2908-14db-430d-a1f8-c40805c1946f","year":2019},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.652260Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:9c32d626c7f8daccab63512e5a066c36142e02263705514b59865e5c5b2c2361","observation_id":"b5a952e3-f91e-4b85-8964-dabafbc4555b","resolution":{"observed_at":"2026-08-06T13:10:19.997933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10248","last_updated":"2022-09-21T10:21:25Z","snapshot_observed_at":"2026-07-06T13:54:41.673948Z","submitted_at":"2022-09-21T10:21:25Z","title":"BEVStereo: Enhancing Depth Estimation in Multi-view 3D Object Detection with Dynamic Temporal Stereo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10248","snapshot_observed_at":"2026-08-06T13:10:19.655037Z","title":"Bevstereo: Enhancing depth estimation in multi-view 3d object detection with dynamic temporal stereo,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.655037Z"},"links":{"cited_paper":"/paper/2209.10248","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:81daacfcab40c5275735d1c4644757826bbff4e4e0fb505b0e6b15b2b9c87ceb","observation_id":"1ac2cb44-4b75-48fc-8693-e62c4f323582","resolution":{"observed_at":"2026-08-06T13:10:19.655037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11790","last_updated":"2022-06-16T09:15:52Z","snapshot_observed_at":"2026-07-06T12:21:28.059661Z","submitted_at":"2021-12-22T10:48:06Z","title":"BEVDet: High-performance Multi-camera 3D Object Detection in Bird-Eye-View","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.11790","snapshot_observed_at":"2026-08-06T13:10:19.658377Z","title":"Bevdet: High-performance multi-camera 3d object detection in bird-eye-view,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.658377Z"},"links":{"cited_paper":"/paper/2112.11790","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:94b4baee0a7755266f85b3653bbf98f944a5654138ec250b2b57a0461d506d42","observation_id":"5d388c37-6e47-405a-8b7d-541aaada7d42","resolution":{"observed_at":"2026-08-06T13:10:19.658377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.10092","last_updated":"2022-11-30T11:28:11Z","snapshot_observed_at":"2026-08-07T05:22:17.526860Z","submitted_at":"2022-06-21T03:21:18Z","title":"BEVDepth: Acquisition of Reliable Depth for Multi-view 3D Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.10092","snapshot_observed_at":"2026-08-06T13:10:19.661686Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detection,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.661686Z"},"links":{"cited_paper":"/paper/2206.10092","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:1aee509710b4f1485f2adb955057727e5ded9c1625b884e19c2880479f889227","observation_id":"9e1ce769-8d07-4799-8ffc-ff03fae697a9","resolution":{"observed_at":"2026-08-06T13:10:19.661686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.985418Z","title":"Fb-bev: Bev representation from forward-backward view transforma- tions,","venue":null,"work_id":"fe8cef9d-469a-4cd8-975c-7855b8656b78","year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.665126Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:50b4315042c7e0ac178a7bdc573af703cc42eb196b4c4f97e92ee4eff9035554","observation_id":"2d5833da-06e8-47c6-9b29-e4e6a6b478de","resolution":{"observed_at":"2026-08-06T13:10:19.988569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.975125Z","title":"Bev-lanedet: a simple and effective 3d lane detection baseline,","venue":null,"work_id":"5c19341f-de25-43f3-bd00-0bb75565a1b4","year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.668530Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:5b68f8b393afd63327f65ac5981a0deba91f062effe7b99583806d39cefbc4f3","observation_id":"e6b0ca9e-0602-41d3-bb94-808e2efe7828","resolution":{"observed_at":"2026-08-06T13:10:19.978483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.17111","last_updated":"2022-11-30T15:55:38Z","snapshot_observed_at":"2026-08-05T20:16:02.949910Z","submitted_at":"2022-11-30T15:55:38Z","title":"BEVPoolv2: A Cutting-edge Implementation of BEVDet Toward Deployment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.17111","snapshot_observed_at":"2026-08-06T13:10:19.671864Z","title":"Bevpoolv2: A cutting-edge implementa- tion of bevdet toward deployment,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.671864Z"},"links":{"cited_paper":"/paper/2211.17111","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:da1112e4e3143c345a1c3586f8011bf1abef73ccd75c50a1a4a3432f01faf5ee","observation_id":"3f179b53-af08-45c0-8b07-880544e8b806","resolution":{"observed_at":"2026-08-06T13:10:19.671864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.07870","last_updated":"2023-01-19T03:58:48Z","snapshot_observed_at":"2026-08-05T03:37:37.413906Z","submitted_at":"2023-01-19T03:58:48Z","title":"Fast-BEV: Towards Real-time On-vehicle Bird's-Eye View Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.07870","snapshot_observed_at":"2026-08-06T13:10:19.675413Z","title":"Fast-bev: Towards real-time on-vehicle bird’s-eye view perception,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.675413Z"},"links":{"cited_paper":"/paper/2301.07870","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:8832f12c29379f47c194074f49a0c6a2ec5601317e9798e212ad21f7b695882a","observation_id":"b016de49-931b-416e-8d50-60812544b475","resolution":{"observed_at":"2026-08-06T13:10:19.675413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.678625Z","title":"Focal loss for dense object detection,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.678625Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:55eec8abfdc5f4bd14b6c82947b40bf35f0e0b85c715243dbfd550189de03c62","observation_id":"03e0f2ca-9551-4cc6-a983-a4da53212b0f","resolution":{"observed_at":"2026-08-06T13:10:19.678625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.959763Z","title":"The lov ´asz-softmax loss: A tractable surrogate for the optimization of the intersection- over-union measure in neural networks,","venue":null,"work_id":"df4745c9-48fd-4976-8717-57377b952979","year":2018},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.681530Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:464030ead21905ead949426fde83a70cb5d5b47a594d62e8eb05fbf1c0e755b6","observation_id":"e6b9a5a9-58f5-4fd7-af79-c421eec93416","resolution":{"observed_at":"2026-08-06T13:10:19.962703Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.684605Z","title":"nuscenes: A multimodal dataset for autonomous driving,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.684605Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:7e7efc82b29c4c9bc1d1fcf192e860be31b65a745fcff0de81d099af805c1313","observation_id":"25eac546-1918-418b-98f8-7b30c497bfd8","resolution":{"observed_at":"2026-08-06T13:10:19.684605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.05778","last_updated":"2023-04-17T11:51:12Z","snapshot_observed_at":"2026-07-06T14:16:52.598523Z","submitted_at":"2022-11-10T18:59:04Z","title":"InternImage: Exploring Large-Scale Vision Foundation Models with Deformable Convolutions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.05778","snapshot_observed_at":"2026-08-06T13:10:19.687685Z","title":"Internimage: Exploring large-scale vision foundation models with deformable convolutions,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.687685Z"},"links":{"cited_paper":"/paper/2211.05778","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:9dcadcf90e5b768aa57bbc931920635b1b67d2957b01e47fc8a4130e8c1dfde5","observation_id":"16d200ed-55ca-44ae-9ac0-dd417168cd57","resolution":{"observed_at":"2026-08-06T13:10:19.687685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.690820Z","title":"Deep residual learning for image recognition,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.690820Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:e3588b97e9f3bd9e1c575fa9d962812e957c606cd2f0edf81ec403b15219fa99","observation_id":"8b27219d-2a9f-4aff-bb94-2ec0b5228384","resolution":{"observed_at":"2026-08-06T13:10:19.690820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.937917Z","title":"Improving deep neural networks using softplus units,","venue":null,"work_id":"bac4e2d9-a846-419d-b96a-3e807dd2babe","year":2015},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.693952Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:023c19eab4722f34347b897c4ea57a56a9f3536a333a55e26ed0427d350e4fe9","observation_id":"83155d89-7887-408e-9f7e-c901a983992e","resolution":{"observed_at":"2026-08-06T13:10:19.941420Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T13:10:19.696727Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.696727Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:5a1321c82e296be146530e73eaefda20b58f87fa64b047ae132477b794b3bc21","observation_id":"f1737001-4f76-4b51-bee9-e2db65199c7e","resolution":{"observed_at":"2026-08-06T13:10:19.696727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T13:10:19.928431Z","title":"Fcos3d: Fully convolutional one-stage monocular 3d object detection,","venue":null,"work_id":"8138eabd-a725-4401-9f90-df369248891d","year":2021},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.700130Z"},"links":{"citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:72e8f7622ce2f2e926f84271d53d6f226f17cc7c1fccee8363a35a5c4e673901","observation_id":"2544c67f-1ff2-44ba-b471-dcc678288944","resolution":{"observed_at":"2026-08-06T13:10:19.931481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.10013","last_updated":"2023-06-16T17:59:33Z","snapshot_observed_at":"2026-07-06T15:43:35.260552Z","submitted_at":"2023-06-16T17:59:33Z","title":"PanoOcc: Unified Occupancy Representation for Camera-based 3D Panoptic Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.10013","snapshot_observed_at":"2026-08-06T13:10:19.617353Z","title":"Available: https://arxiv.org/abs/2306.10013","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T13:10:19.617353Z"},"links":{"cited_paper":"/paper/2306.10013","citing_paper":"/paper/2507.20963"},"observation_digest":"sha256:9a08cd91bebbbc89955990d258c3abc177762d3cefc07d1be69602a76bf642fd","observation_id":"4a3c837c-6787-4cc6-9a22-ab7410776dc1","resolution":{"observed_at":"2026-08-06T13:10:19.617353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.20963","last_updated":"2025-07-28T16:18:29Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T13:10:18.984597Z","submitted_at":"2025-07-28T16:18:29Z","title":"GTAD: Global Temporal Aggregation Denoising Learning for 3D Semantic Occupancy Prediction"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.20963."}