{"as_of":"2026-08-07T15:39:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:402e0c87fc9ce8a27e225612fb22d239fb5f59b105271a5cbc44588b929ca837","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:21:43.120620Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.08555/citation-record","integrity":"/paper/2507.08555/integrity","json":"/paper/2507.08555/citation-record.json","paper":"/paper/2507.08555"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.982826Z","title":"Se- mantickitti: A dataset for semantic scene understanding of lidar sequences","venue":null,"work_id":"ca270d2a-2592-49e5-ad00-361ec3222c2f","year":2019},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:38.744920Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:c42db07893e9b174940e6683943289e9e49792e02767b9e99dfbec0ca1869f2b","observation_id":"73649dd4-2bd2-4c14-95e1-329876e0de47","resolution":{"observed_at":"2026-08-06T18:21:51.097579Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.777321Z","title":"Monoscene: Monoc- ular 3d semantic scene completion","venue":null,"work_id":"cee98297-173a-4ba8-9885-94eec2bb47e8","year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:38.837013Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:9110749e2329dcebbaf1d47afbd019dc2849d2b22ea715cbf01899cd6d16eb32","observation_id":"236d985a-08b2-470f-8691-fcdcc231c4ec","resolution":{"observed_at":"2026-08-06T18:21:50.839874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.548191Z","title":"Persformer: 3d lane detection via perspec- tive transformer and the openlane benchmark","venue":null,"work_id":"d5415ebd-eddd-4cd2-8727-fea9649566f3","year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:38.911582Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:e3816ef5364ae4b80462c4cc76cd32483f71792652b60be3f2ae445d7dc7b898","observation_id":"0d83f4b2-3af2-4fd5-a1d0-651e5a8e49f3","resolution":{"observed_at":"2026-08-06T18:21:50.641230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.391879Z","title":"Delving into the trajectory long-tail distribution for muti-object track- ing","venue":null,"work_id":"8537633c-aa85-42c0-837e-1d3890783fba","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.007894Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:622918c8845fa1f2625b034e76fa57235a26898a92962e287ee23ff9d0d898f2","observation_id":"4db73065-77e2-40d6-8c87-404a554b0c38","resolution":{"observed_at":"2026-08-06T18:21:50.469436Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:39.085861Z","title":"Cross-view referring multi-object tracking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.085861Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:5d1f20efd9e6557b3912d53c2de964834fed2feb582d05f0e9354a055e4281bc","observation_id":"c6a73c0f-53bd-4f87-b3cd-4d1468fb9e31","resolution":{"observed_at":"2026-08-06T18:21:39.085861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:50.140597Z","title":"S3cnet: A sparse semantic scene completion net- work for lidar point clouds","venue":null,"work_id":"9a0a9200-de95-44dc-8e7c-66fe72302892","year":2021},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.142402Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:caaeb370c5cab82f3ec3fc16b545af886c17ce0c9054d8ec22939ae4fd23af29","observation_id":"e110266b-7246-417e-aaad-f5d086a88d23","resolution":{"observed_at":"2026-08-06T18:21:50.241733Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.937561Z","title":"Gitnet: Geometric prior- based transformation for birds-eye-view segmentation","venue":null,"work_id":"fb3bb865-799d-4e86-8f60-24f69ab11bd3","year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.255132Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:b86638d65b3304d053d72988c6ccd1a482d9f869fe89cb1d5381fe1d1ea02754","observation_id":"7f6ceb49-1c32-4dee-b767-1b5b1508065f","resolution":{"observed_at":"2026-08-06T18:21:50.021312Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.727400Z","title":"Simple-bev: What really mat- ters for multi-sensor bev perception? In2023 IEEE Inter- national Conference on Robotics and Automation (ICRA), pages 2759–2765","venue":null,"work_id":"649b1e72-a420-4bce-a5c3-c515953bc74b","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.320271Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:6af1089e65362992bb9e9274c329825ddb1ac33e1f49cffd51a36cddfcc3cdea","observation_id":"79543a9f-e338-48b2-8458-e59f4a63ba3c","resolution":{"observed_at":"2026-08-06T18:21:49.821190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:39.381989Z","title":"Deep residual learning for image recognition","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.381989Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:990b1d53a8cf7c4fbedf7752a2b9f25e5bd4333e55b9f175a06f40ac70ea8fec","observation_id":"4a273735-a217-4e5e-8f0a-bcaaa1c61011","resolution":{"observed_at":"2026-08-06T18:21:39.381989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02710","last_updated":"2024-03-05T07:01:53Z","snapshot_observed_at":"2026-07-06T17:39:41.498480Z","submitted_at":"2024-03-05T07:01:53Z","title":"FastOcc: Accelerating 3D Occupancy Prediction by Fusing the 2D Bird's-Eye View and Perspective View","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02710","snapshot_observed_at":"2026-08-06T18:21:39.503168Z","title":"Fas- tocc: Accelerating 3d occupancy prediction by fusing the 2d bird’s-eye view and perspective view.arXiv preprint arXiv:2403.02710, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.503168Z"},"links":{"cited_paper":"/paper/2403.02710","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:01a05bcfa36bc5e54b234e2deae22ecba444d17812eb8c6ee1de89bf88848713","observation_id":"af355905-26f2-4b7c-ae82-9e5d233ad0f5","resolution":{"observed_at":"2026-08-06T18:21:39.503168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.524774Z","title":"Planning-oriented autonomous driving","venue":null,"work_id":"c7f28d56-8732-4a0b-abee-b97e92555608","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.558880Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:34654ab8b2ab6a13f7a3311f07409d74a9cf89f15df890ace5369d1a54173983","observation_id":"5b58932a-7e1c-424f-8660-7f7fc4bcc025","resolution":{"observed_at":"2026-08-06T18:21:49.627590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:39.605909Z","title":"Tri-perspective view for vision- based 3d semantic occupancy prediction","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.605909Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:0fea84ab396145bd64b9e5f3dcebe8cbbfb46811e259ef1659db940c31a82638","observation_id":"65299f62-020f-4c80-98d5-ac0294be2fbd","resolution":{"observed_at":"2026-08-06T18:21:39.605909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.294150Z","title":"Sym- phonize 3d semantic scene completion with contextual in- stance queries","venue":null,"work_id":"189cc775-3355-4fa1-950d-1693045ac89e","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.718481Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:b79fd5ee4b27931eedf627e30296855a748f4f34afe9ec1cf2e6cb931ebd3f3c","observation_id":"81622963-c5e4-4b29-806a-7823f7b5df7a","resolution":{"observed_at":"2026-08-06T18:21:49.402721Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:49.101043Z","title":"Polarformer: Multi- camera 3d object detection with polar transformer","venue":null,"work_id":"baec61ea-4237-4699-892a-ae50c4e587f8","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.836020Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:50b0f9adfd06124d77d6f4fb4a815e916273bb8afddf4a39e42c46c2fa66efc7","observation_id":"125a9fe4-aab2-4a85-997a-e0750fb213b7","resolution":{"observed_at":"2026-08-06T18:21:49.205272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.893714Z","title":"Tod3cap: Towards 3d dense captioning in outdoor scenes","venue":null,"work_id":"bc0eec87-120c-4c5d-b2d8-d4dba027b928","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:39.970675Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:eeb33baf696817ab7dbf4cbfde08e6f644afc7cfe64c6f937ec8e9e5fceacb95","observation_id":"ab138368-9b1c-4d52-bb7a-0a771b3b366b","resolution":{"observed_at":"2026-08-06T18:21:48.979584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03551","last_updated":"2025-08-14T04:31:02Z","snapshot_observed_at":"2026-08-04T07:30:07.776651Z","submitted_at":"2024-08-07T05:23:52Z","title":"VPOcc: Exploiting Vanishing Point for 3D Semantic Occupancy Prediction","version":2},"cited_work":{"arxiv_id":"2408.03551","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.03551","snapshot_observed_at":"2026-08-06T18:21:43.474269Z","title":"VPOcc: Exploiting Vanishing Point for 3D Semantic Occupancy Prediction","venue":"cs.CV","work_id":"1cf9d236-486c-4942-8ab0-9839829311dc","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.049085Z"},"links":{"cited_paper":"/paper/2408.03551","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:71c1f674cc2e09e15250cef03485f0bc3e0deec2eafdd09354f81dd1a1771062","observation_id":"64c1e440-944b-441e-8257-4dfacdbca1e1","resolution":{"observed_at":"2026-08-06T18:21:43.568122Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.13959","last_updated":"2024-05-06T15:14:22Z","snapshot_observed_at":"2026-07-06T15:07:37.299096Z","submitted_at":"2023-03-24T12:33:44Z","title":"Bridging Stereo Geometry and BEV Representation with Reliable Mutual Interaction for Semantic Scene Completion","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.13959","snapshot_observed_at":"2026-08-06T18:21:40.127356Z","title":"Stereoscene: Bev-assisted stereo match- ing empowers 3d semantic scene completion.arXiv preprint arXiv:2303.13959, 1(3):6, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.127356Z"},"links":{"cited_paper":"/paper/2303.13959","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:9aad010a5a4fa46fffba66ff12128c741feda2c5d07a709aa3405de9d9973149","observation_id":"581c74d2-9f70-47a1-845b-a0f41c1c1e51","resolution":{"observed_at":"2026-08-06T18:21:40.127356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.702947Z","title":"Hierarchical temporal context learning for camera-based semantic scene comple- tion","venue":null,"work_id":"0e2139ed-8485-4146-8f47-1a8d02e8f5ca","year":2025},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.186666Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:160977f043219208d4b6b6843fc4a2bdddece4d5eb7491e28e96525bbe70bbc9","observation_id":"973f485c-3f4a-4b1f-b8f2-2897b5032949","resolution":{"observed_at":"2026-08-06T18:21:48.793217Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.551101Z","title":"Mask dino: Towards a unified transformer-based framework for object detection and segmentation","venue":null,"work_id":"90c676c2-38ca-4fbf-a3a7-f3b6860a6fda","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.306381Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:8784a5d60c2fd2066ad83679502a28a8364edb451bf5b9db3130f2204e57c34e","observation_id":"41d440ea-42e8-4c08-80d1-b094e1914949","resolution":{"observed_at":"2026-08-06T18:21:48.636845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.417042Z","title":"Delving into the devils of bird’s- eye-view perception: A review, evaluation and recipe.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2023","venue":null,"work_id":"11b2d856-c4c5-41e8-aff2-e0f30da6c807","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.376290Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:ebb5c87b4e4653f20c0dd3bd8a6f562f6376bbfa603c0b79b06c5c447ef2dd9b","observation_id":"8aa57a2c-08ba-45a4-accd-3c85b5594102","resolution":{"observed_at":"2026-08-06T18:21:48.465746Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.185243Z","title":"Ovtr: End-to-end open-vocabulary multiple object tracking with transformer","venue":null,"work_id":"e79c82d7-ef27-418a-9491-4066f5b53344","year":null},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.438470Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:6b96c356681b742c2a3d8ff307016935621549687dbd972562779b60523e3921","observation_id":"f6361db9-cb64-49bd-a5db-cd608176d4db","resolution":{"observed_at":"2026-08-06T18:21:48.304165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:48.009892Z","title":"Bevstereo: Enhancing depth estimation in multi-view 3d object detection with temporal stereo","venue":null,"work_id":"c62f099a-b601-46b4-a776-176f223b7372","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.481808Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:40b2f15e0149b195c1ddf22ce16e49b856f0690bbe7f4715bf3a9f71fe80013b","observation_id":"59fb464f-aa4c-4f2f-9932-e2dfde6f8c23","resolution":{"observed_at":"2026-08-06T18:21:48.085135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:47.871679Z","title":"Bevdepth: Acquisition of reliable depth for multi-view 3d object detec- tion","venue":null,"work_id":"6d11850b-6eb3-48de-8ce7-921d56d1a9f5","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.553852Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:8ddda83f160a71266e30eb6f39ed4fe167d82f18e722794a6cc287962bd1d13d","observation_id":"198a884f-3a65-4de8-be0e-50b50dabd0a4","resolution":{"observed_at":"2026-08-06T18:21:47.946382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09001","last_updated":"2024-09-30T13:27:59Z","snapshot_observed_at":"2026-07-06T15:42:52.549767Z","submitted_at":"2023-06-15T09:56:33Z","title":"SSCBench: A Large-Scale 3D Semantic Scene Completion Benchmark for Autonomous Driving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09001","snapshot_observed_at":"2026-08-06T18:21:40.623095Z","title":"Sscbench: A large-scale 3d semantic scene com- pletion benchmark for autonomous driving.arXiv preprint arXiv:2306.09001, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.623095Z"},"links":{"cited_paper":"/paper/2306.09001","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:c2648c5652effc5d7320424f45803063f3a9d8a66456c584da610ea26f1ae8de","observation_id":"139967ae-2f61-4837-9cb7-68083d59cc62","resolution":{"observed_at":"2026-08-06T18:21:40.623095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:47.687037Z","title":"V oxformer: Sparse voxel transformer for camera- based 3d semantic scene completion","venue":null,"work_id":"12ac9672-4741-4062-baf1-98fa0d18e723","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.709560Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:d84b2d6743be62a71e5860cf0c45bf347015282d42e9e6f8ce24bb055572a625","observation_id":"5dedb99d-0934-4606-a920-8f55660843ab","resolution":{"observed_at":"2026-08-06T18:21:47.777005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:47.525203Z","title":"Bevformer: Learning bird’s-eye-view representation from multi-camera images via spatiotemporal transformers","venue":null,"work_id":"8e685db0-abee-47f2-99a7-0c9eb665f0cd","year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.803191Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:9d271dc635a10f9107a87b2a5453f17e2f4847568e66a1c0127bf527f21e7069","observation_id":"f532b265-c827-4825-b9f2-4553471cb3e6","resolution":{"observed_at":"2026-08-06T18:21:47.599985Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T18:21:40.869417Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.869417Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:9ddbb631701306f438486a963f30b20ec55301336288bf3ad27aaba2e5d26d9a","observation_id":"108e2644-f07f-4b56-aed6-24c0cfeff466","resolution":{"observed_at":"2026-08-06T18:21:40.869417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13540","last_updated":"2023-02-27T06:35:03Z","snapshot_observed_at":"2026-08-04T09:40:33.174673Z","submitted_at":"2023-02-27T06:35:03Z","title":"OccDepth: A Depth-Aware Method for 3D Semantic Scene Completion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13540","snapshot_observed_at":"2026-08-06T18:21:40.991157Z","title":"Occdepth: A depth-aware method for 3d semantic scene completion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:40.991157Z"},"links":{"cited_paper":"/paper/2302.13540","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:314a94643c69c9f62bfd65bf9e6170d1a18b99e4c4e243c73f71a8b1725cbde4","observation_id":"a33baebd-8156-4f1e-ab99-3e25a466b3a9","resolution":{"observed_at":"2026-08-06T18:21:40.991157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:47.305651Z","title":"Lift, splat, shoot: Encoding images from arbitrary camera rigs by implicitly unproject- ing to 3d","venue":null,"work_id":"b9ef1b66-ea17-4d2d-9fd6-cc05b18c8f0c","year":2020},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.056542Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:24e851e200a2642acd0823ce8b4ffc2a7785dbc07833462797b1999d2db795cf","observation_id":"28537db5-3a73-43dd-b3f3-ddfdb0e63dee","resolution":{"observed_at":"2026-08-06T18:21:47.427855Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:47.142880Z","title":"Categorical depth distribution network for monocular 3d object detection","venue":null,"work_id":"8533cf63-61e5-4622-9104-9de567cb4c7c","year":2021},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.160432Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:c7cf3f03bf0fd94097197cd069bdc6d551093ad59f79f93bf237d0d575a0f0bb","observation_id":"f3b31132-5989-4f3d-a8b8-41eda2e3dcdc","resolution":{"observed_at":"2026-08-06T18:21:47.198667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.961820Z","title":"Lmscnet: Lightweight multiscale 3d semantic completion","venue":null,"work_id":"ebe8c706-316e-4335-86de-c5e7a2a80ce0","year":2020},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.236522Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:dacf2490257852a4c8802bcfe6a706ba1c0db5caf740fe99799276518c8ad988","observation_id":"00a57d22-463f-44c6-93a5-abea013f55a4","resolution":{"observed_at":"2026-08-06T18:21:47.045968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.740464Z","title":"U- net: Convolutional networks for biomedical image segmen- tation","venue":null,"work_id":"86da503c-c22b-4024-9c43-f2a189a9716a","year":2015},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.316251Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:afa4e9f840879717fbd07c08d574861399925fe49aebbf08013262368fa6ce9f","observation_id":"a948feb3-e0ed-4293-8915-2c1ea89da643","resolution":{"observed_at":"2026-08-06T18:21:46.829686Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.462500Z","title":"Focal loss for dense ob- ject detection","venue":null,"work_id":"6a02a115-5669-4999-a61a-5896ee3ca948","year":2017},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.458616Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:2d9d42847da022612ab4ab9ecfb3b5437e8675b0967b14486b622e14f7c666ef","observation_id":"50132c13-adf3-4836-8bee-c2518ad441e0","resolution":{"observed_at":"2026-08-06T18:21:46.602722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.216886Z","title":"Translating images into maps","venue":null,"work_id":"82503f42-94f5-4319-a920-6740a9bbce17","year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.536517Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:f49749c106a855498c6e90fd238b4fac5780a64ae8e8377bdb51a97863eda9ed","observation_id":"3c949ebf-a68a-40f1-8ddf-4abd6cf38d12","resolution":{"observed_at":"2026-08-06T18:21:46.304676Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:46.049713Z","title":"Mobilestereonet: Towards lightweight deep net- works for stereo matching","venue":null,"work_id":"4e690248-fcaf-437a-a6a7-10d98407e947","year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.614326Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:d0692fd9152cd702eb9dcbddfb6ea16bda54a17b7ecb6026a2c164d919984683","observation_id":"ea497db7-b2df-4306-a306-6efa23cfd2e0","resolution":{"observed_at":"2026-08-06T18:21:46.148876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:45.863910Z","title":"Semantic scene com- pletion from a single depth image","venue":null,"work_id":"d3707b96-9016-40cc-898e-95c55d258024","year":2017},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.681313Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:3b79ff899e9146a9e4ba2e97f288391728327c9e649e7bdf41e7fdd8e42c7331","observation_id":"cf3967ed-d107-430d-a447-8bebbd0d7669","resolution":{"observed_at":"2026-08-06T18:21:45.930459Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:45.630060Z","title":"Occ3d: A large-scale 3d occupancy prediction benchmark for autonomous driving.Advances in Neural Information Processing Systems, 36:64318–64330, 2023","venue":null,"work_id":"1c9a15cd-a8bc-44fe-8773-c76fdf4c0ebf","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.753203Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:0c0cb241cd0bc5b98f2a4222b345eed23add18e54ab32f56d82d607246811af5","observation_id":"a6434ba4-6f92-460b-bdb7-72952afbff24","resolution":{"observed_at":"2026-08-06T18:21:45.781554Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:45.429101Z","title":"Not all voxels are equal: Hardness-aware semantic scene completion with self- distillation","venue":null,"work_id":"30078f0a-3651-48a9-a29a-cf75071f09d2","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:41.917891Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:0547c394ab18af0522b013378151cf7358fc49b0cff7aa594e8f00cc875bc508","observation_id":"717820dd-1e35-4d03-b3d6-af1d0cb366ac","resolution":{"observed_at":"2026-08-06T18:21:45.512085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:45.310359Z","title":"Bevspread: Spread voxel pooling for bird’s-eye- view representation in vision-based roadside 3d object detec- tion","venue":null,"work_id":"ddadb863-d3b0-45e0-97d5-e9344ba24270","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.003041Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:1c40c9f3550e13617439cee549e2b0cebd26d54e22386d05584cbfabd3122179","observation_id":"99b6ea6d-1d9d-4551-a39a-c530e116bc02","resolution":{"observed_at":"2026-08-06T18:21:45.356864Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:45.131803Z","title":"H2gformer: Horizontal-to-global voxel transformer for 3d semantic scene completion","venue":null,"work_id":"5f6e7ec8-94a4-4430-80a3-b75a85fe3d6b","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.074263Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:01081dd6aeaf5e2e30dc91a022c26359e16139856b151c30a2e054856afa62fd","observation_id":"8f51239d-dc5f-4741-bf3c-343586131fee","resolution":{"observed_at":"2026-08-06T18:21:45.190995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.985998Z","title":"Surroundocc: Multi-camera 3d occu- pancy prediction for autonomous driving","venue":null,"work_id":"80dd7fe5-87c8-4abb-acdb-636723056cfa","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.149160Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:6d193eb9a5bc2c3342352964cce1872df7252b23755c1afa64d1e62fb6ca5b2f","observation_id":"0e4d6694-6e82-4864-870b-c3a089bd2b93","resolution":{"observed_at":"2026-08-06T18:21:45.055749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.827334Z","title":"Instance-aware monocular 3d semantic scene comple- tion.IEEE Transactions on Intelligent Transportation Sys- tems, 2024","venue":null,"work_id":"c1fb1c90-06fd-4c64-9121-bc2bf675801d","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.199888Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:ca7bba648ff30b926072a87c521fce4775b847a7918367297680ce8600b6a8c3","observation_id":"7a530b40-ed71-45e5-b268-fbf79d203609","resolution":{"observed_at":"2026-08-06T18:21:44.899562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02202","last_updated":"2022-09-25T07:19:32Z","snapshot_observed_at":"2026-07-06T13:28:05.405493Z","submitted_at":"2022-07-05T17:59:28Z","title":"CoBEVT: Cooperative Bird's Eye View Semantic Segmentation with Sparse Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.02202","snapshot_observed_at":"2026-08-06T18:21:42.294141Z","title":"Cobevt: Cooperative bird’s eye view semantic segmentation with sparse transformers.arXiv preprint arXiv:2207.02202, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.294141Z"},"links":{"cited_paper":"/paper/2207.02202","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:fafbe65878ca90fac5307103c463ae5caa7c3d8da232f4b7c0fcbf56b0e48819","observation_id":"ea5cd2da-95c5-4d6b-8dcf-5b2f6596248f","resolution":{"observed_at":"2026-08-06T18:21:42.294141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.636136Z","title":"Sparse single sweep lidar point cloud segmentation via learning contextual shape priors from scene completion","venue":null,"work_id":"6d22d700-77ff-4e6f-88e4-1e2d2915bf77","year":2021},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.400518Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:b0aa045dfc6c8c6b1e5eb05400c71327bbaf3fdfb2bd6728e45e715418ac13b0","observation_id":"8b16e03d-37b3-4970-b617-3454201319e3","resolution":{"observed_at":"2026-08-06T18:21:44.705812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17084","last_updated":"2024-11-25T23:13:35Z","snapshot_observed_at":"2026-07-06T16:53:58.875152Z","submitted_at":"2023-11-28T01:47:51Z","title":"DepthSSC: Monocular 3D Semantic Scene Completion via Depth-Spatial Alignment and Voxel Adaptation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17084","snapshot_observed_at":"2026-08-06T18:21:42.471492Z","title":"Depthssc: Depth- spatial alignment and dynamic voxel resolution for monoc- ular 3d semantic scene completion.arXiv preprint arXiv:2311.17084, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.471492Z"},"links":{"cited_paper":"/paper/2311.17084","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:b74fc4909705e6fd1e5a9947a1c4b87ff0351be4072ae7dd576bf95a1389f3ef","observation_id":"03c20fe1-3f9d-452e-9066-e13d7fa3b603","resolution":{"observed_at":"2026-08-06T18:21:42.471492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14298","last_updated":"2023-05-23T17:40:13Z","snapshot_observed_at":"2026-07-06T15:31:41.985646Z","submitted_at":"2023-05-23T17:40:13Z","title":"MOTRv3: Release-Fetch Supervision for End-to-End Multi-Object Tracking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14298","snapshot_observed_at":"2026-08-06T18:21:42.533311Z","title":"Motrv3: Release-fetch super- vision for end-to-end multi-object tracking.arXiv preprint arXiv:2305.14298, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.533311Z"},"links":{"cited_paper":"/paper/2305.14298","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:37e4462845447ff2c91e8ac943a6b1d1b5e1de84dd7a6cd36b185a068908eeff","observation_id":"7ce891ac-417f-402a-885a-c5eeb5481b72","resolution":{"observed_at":"2026-08-06T18:21:42.533311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.490289Z","title":"Merlin: Empowering multimodal llms with foresight minds","venue":null,"work_id":"12d3a2cb-85db-47b5-a314-edfabc11c592","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.631558Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:606f1ed3a232f7a719853d616c857b1606ed44b7c76b3081b1a41617eceb800d","observation_id":"75b4ab9f-8fec-4f41-b013-356c4c270eb9","resolution":{"observed_at":"2026-08-06T18:21:44.549283Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12058","last_updated":"2023-11-18T15:28:09Z","snapshot_observed_at":"2026-07-06T16:50:10.189504Z","submitted_at":"2023-11-18T15:28:09Z","title":"FlashOcc: Fast and Memory-Efficient Occupancy Prediction via Channel-to-Height Plugin","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12058","snapshot_observed_at":"2026-08-06T18:21:42.767511Z","title":"Flashocc: Fast and memory-efficient occupancy prediction via channel-to-height plugin.arXiv preprint arXiv:2311.12058, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.767511Z"},"links":{"cited_paper":"/paper/2311.12058","citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:fab58a9579b68605a0261cf0a70f7811049ec5c621793c2847bbb754936306b7","observation_id":"0facdfd7-ec01-4650-b085-30fed99edf7d","resolution":{"observed_at":"2026-08-06T18:21:42.767511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.235232Z","title":"Context and geometry aware voxel transformer for semantic scene completion","venue":null,"work_id":"4695b510-f1c5-4c66-a540-16b6b4e0b178","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.870402Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:1613f894371bae5c2cb59509c6c0ff6e9b16afd99991a377528745fb6e91cbe3","observation_id":"8b4a0e83-b409-472f-89da-dabbb8f26a1e","resolution":{"observed_at":"2026-08-06T18:21:44.390163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:44.060872Z","title":"Sa-bev: Generating semantic-aware bird’s-eye-view feature for multi-view 3d object detection","venue":null,"work_id":"89947a0a-387a-4130-bf1d-1ce31e5482a9","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:42.958671Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:58b0c078a03d3bab03e26af352a3fa7c40c46f313a41d269a69bfb8d5dfce186","observation_id":"9b3c79a7-76a4-4008-b44e-af1d3f0880e6","resolution":{"observed_at":"2026-08-06T18:21:44.126368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:43.924444Z","title":"Occformer: Dual-path transformer for vision-based 3d semantic occu- pancy prediction","venue":null,"work_id":"6bd3b0e4-42b7-4a3c-b32a-4d4fb23421e0","year":2023},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:43.030850Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:08d644c6ef05f7b70344b8a99b33c8621b6f5ac6615a05b6ac9f6865be5361d9","observation_id":"e8cb02c0-f6b5-4a2c-97ac-55a0af893b4e","resolution":{"observed_at":"2026-08-06T18:21:43.969925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T18:21:43.706053Z","title":"Monoocc: Digging into monocular semantic occu- pancy prediction","venue":null,"work_id":"320272c3-3fc8-40f8-b674-2d2446307fab","year":2024},"citing_paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T18:21:43.120620Z"},"links":{"citing_paper":"/paper/2507.08555"},"observation_digest":"sha256:113c66648f8a603b9342034575aef215fabe8d6286edba225f2ac4968c22af0d","observation_id":"284f97fb-bcf0-4606-b213-5a8b7c881e93","resolution":{"observed_at":"2026-08-06T18:21:43.805047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.08555","last_updated":"2025-07-11T12:57:14Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T18:12:57.797732Z","submitted_at":"2025-07-11T12:57:14Z","title":"Disentangling Instance and Scene Contexts for 3D Semantic Scene Completion"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":1,"verified_fuzzy":39},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2507.08555."}