{"as_of":"2026-08-18T04:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:12478ed135775f70ef517a0bbdc6a8dc2fc7afbc8ad182852cec13fab97b7d9c","coverage":[{"denominator":18,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T20:34:09.063740Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.12693/citation-record","integrity":"/paper/2505.12693/integrity","json":"/paper/2505.12693/citation-record.json","paper":"/paper/2505.12693"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.15676","last_updated":"2026-06-01T14:59:35Z","snapshot_observed_at":"2026-08-16T14:49:25.586477Z","submitted_at":"2023-10-24T09:39:05Z","title":"Recent Advances in Multi-modal 3D Intelligence: A Comprehensive Survey and Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15676","snapshot_observed_at":"2026-08-15T20:34:08.960406Z","title":"Recent advances in multi- modal 3d scene understanding: A comprehensive survey and evaluation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.960406Z"},"links":{"cited_paper":"/paper/2310.15676","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:edbcec85b04c37fc07268b04aa0140a0a6c4457dbec18b3d01957641d10a498e","observation_id":"42db11b3-c41d-4123-9353-998d1c6c9054","resolution":{"observed_at":"2026-08-15T20:34:08.960406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17270","last_updated":"2022-07-13T06:57:28Z","snapshot_observed_at":"2026-08-16T21:18:10.684128Z","submitted_at":"2022-03-31T17:59:01Z","title":"BEVFormer: Learning Bird's-Eye-View Representation from Multi-Camera Images via Spatiotemporal Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17270","snapshot_observed_at":"2026-08-15T20:34:08.967786Z","title":"Zhiqi Li, Zhiding Yu, David Austin, Mingsheng Fang, Shiyi Lan, Jan Kautz, and Jose M Alvarez","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.967786Z"},"links":{"cited_paper":"/paper/2203.17270","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:ea81704218251828f9d9de039d97bd14510c7d79a1e70a456faab839152145fc","observation_id":"d25bf1b2-8013-47eb-871b-60bca5beac60","resolution":{"observed_at":"2026-08-15T20:34:08.967786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T20:34:08.974582Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.974582Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:8e6e8113d673283d756bc59f52c5d274af7b38dc0743236877d79aa38422c627","observation_id":"e7abee49-04d6-4cc7-ad26-68d20ff73f0a","resolution":{"observed_at":"2026-08-15T20:34:08.974582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.332269Z","title":null,"venue":null,"work_id":"014ead89-25c8-4c47-a140-69c23e6e6d74","year":2023},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.063740Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:11f13749d10da379549534a02f345074759004047801de3b11c241d570cd23f6","observation_id":"1258a394-9e55-4df3-a823-d36c65ce4a68","resolution":{"observed_at":"2026-08-15T20:34:09.337957Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09117","last_updated":"2023-06-15T13:23:57Z","snapshot_observed_at":"2026-08-16T15:23:40.421909Z","submitted_at":"2023-06-15T13:23:57Z","title":"UniOcc: Unifying Vision-Centric 3D Occupancy Prediction with Geometric and Semantic Rendering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09117","snapshot_observed_at":"2026-08-15T20:34:09.001601Z","title":"Co-occ: Coupling explicit feature fusion with volume rendering regularization for multi-modal 3d semantic occupancy prediction","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.001601Z"},"links":{"cited_paper":"/paper/2306.09117","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:0f2ea009b90cfb770bdc582d8bec8b259b6f3548e9b070fb1862c12384419865","observation_id":"32e61d29-04e1-4156-9873-0e890380d664","resolution":{"observed_at":"2026-08-15T20:34:09.001601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.425835Z","title":"Renderocc: Vision-centric 3d occupancy prediction with 2d rendering supervision","venue":null,"work_id":"3020ee28-25f8-4263-a86b-e4ec93aa856d","year":2024},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.013556Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:e3128aed442ae452e9890af16c5d8dc7f2f021484448a2661bc2908d94daf92a","observation_id":"4a3e6b9c-5ca3-4302-8da7-2e49f9281f7a","resolution":{"observed_at":"2026-08-15T20:34:09.431495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.405182Z","title":"Occupancy anticipation for efficient explo- ration and navigation","venue":null,"work_id":"a74da948-b4d2-4117-ad19-ad945a75e389","year":2020},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.020186Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:ec37f8f2bf270878d40b730be7581af4a285fd3d47f1664f40a8cbb8822bed00","observation_id":"5237601f-11d3-4bae-8bdd-669b6ff0838d","resolution":{"observed_at":"2026-08-15T20:34:09.411712Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.03821","last_updated":"2021-01-26T08:08:02Z","snapshot_observed_at":"2026-08-18T02:39:24.718471Z","submitted_at":"2019-11-10T01:39:46Z","title":"Adaptive Fusion Techniques for Multimodal Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.03821","snapshot_observed_at":"2026-08-15T20:34:09.034485Z","title":"Dynamic fusion for multimodal data","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.034485Z"},"links":{"cited_paper":"/paper/1911.03821","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:f9112399376006cb2da1ec09f3de8676978a37894d3ed11cae09ddf876167171","observation_id":"5b7a1ca3-2db0-47b2-ad7f-11eaa51d7c89","resolution":{"observed_at":"2026-08-15T20:34:09.034485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.369001Z","title":"Semantic segmentation-assisted scene completion for lidar point clouds","venue":null,"work_id":"583dd36d-7170-4418-b06d-b0fd0bf34f1c","year":2021},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.041004Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:679e0c50d79e05787b4f6e72bae3dd677006ddbc82af10fdd3f3b6b09fd1f260","observation_id":"711d31c2-def0-4e30-b5ed-19e875be3f74","resolution":{"observed_at":"2026-08-15T20:34:09.375495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05662","last_updated":"2019-09-25T14:33:44Z","snapshot_observed_at":"2026-08-14T17:02:42.244835Z","submitted_at":"2019-03-13T18:23:43Z","title":"Understanding Straight-Through Estimator in Training Activation Quantized Neural Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.05662","snapshot_observed_at":"2026-08-15T20:34:09.047000Z","title":"Understanding straight-through estimator in training activation quantized neural nets","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.047000Z"},"links":{"cited_paper":"/paper/1903.05662","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:c063d39dd5a8f4e93aa0d497c32336d6ffc6b9de96363c12e9e8da33346487bb","observation_id":"dce472bf-176e-4f93-9f82-6ff14e2c255d","resolution":{"observed_at":"2026-08-15T20:34:09.047000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02595","last_updated":"2024-07-08T06:30:01Z","snapshot_observed_at":"2026-08-16T13:55:26.942907Z","submitted_at":"2024-05-04T07:39:25Z","title":"Vision-based 3D occupancy prediction in autonomous driving: a review and outlook","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02595","snapshot_observed_at":"2026-08-15T20:34:09.058320Z","title":"Provable dynamic fusion for low-quality multimodal data","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.058320Z"},"links":{"cited_paper":"/paper/2405.02595","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:ed1ff78fc4dc938ffc1a1c8859c213b3878c5e15034fd68b6b128e6fb37bf815","observation_id":"0249f93b-ff51-476a-91c3-ed279fc46b8b","resolution":{"observed_at":"2026-08-15T20:34:09.058320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.445188Z","title":"Ssc-rs: Elevate lidar semantic scene completion with representation separation and bev fusion","venue":null,"work_id":"f3aa2e27-9dc3-47f8-a579-34a2f2c9eff9","year":2023},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.987495Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:1a51b7775f7b11e4823046abc9032121f6369735ab15743ba13cdd2dea37f5ec","observation_id":"1777d019-899b-47cf-8923-ed1dc0c7a780","resolution":{"observed_at":"2026-08-15T20:34:09.450996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.350640Z","title":"Differentiable point-based radiance fields for efficient view synthesis","venue":null,"work_id":"aec7db7a-31c6-4083-9866-b821329dda0e","year":2022},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.052511Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:29ebccb8d9111f3fdc70237291e17a80e9df24f4f3bb274588d5ae96a7fda6c1","observation_id":"97e7b604-9238-4e8c-bcf3-f6b0dcac7abd","resolution":{"observed_at":"2026-08-15T20:34:09.356224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.387981Z","title":"Lmscnet: Lightweight multiscale 3d semantic completion","venue":null,"work_id":"d35776a5-91b3-44eb-aaf9-c06081373517","year":2020},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:09.028144Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:342eaa20a97baa0b28db3c480b83c4335e4b3618060d74e985d22284ddf80fa0","observation_id":"e519a811-c65e-4a3c-a614-1b5d61b297b8","resolution":{"observed_at":"2026-08-15T20:34:09.393291Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04732","last_updated":"2025-04-07T05:08:22Z","snapshot_observed_at":"2026-08-16T21:17:56.572839Z","submitted_at":"2025-04-07T05:08:22Z","title":"Inverse++: Vision-Centric 3D Semantic Occupancy Prediction Assisted with 3D Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04732","snapshot_observed_at":"2026-08-15T20:34:08.994823Z","title":"Inverse++: Vision-centric 3d semantic occupancy prediction assisted with 3d object detection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.994823Z"},"links":{"cited_paper":"/paper/2504.04732","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:854afb546f78b3e18885d0e51d625684f8be24970d927eda77045add04299550","observation_id":"7ffe018c-1912-4685-9565-9ab5e10c6e93","resolution":{"observed_at":"2026-08-15T20:34:08.994823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09941","last_updated":"2025-03-13T01:35:04Z","snapshot_observed_at":"2026-08-16T12:50:33.021581Z","submitted_at":"2025-03-13T01:35:04Z","title":"TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness","version":1},"cited_work":{"arxiv_id":"2503.09941","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.09941","snapshot_observed_at":"2026-08-15T20:34:09.308817Z","title":"TGP: Two-modal occupancy prediction with 3D Gaussian and sparse points for 3D Environment Awareness","venue":"cs.CV","work_id":"543042f8-22e6-4f0f-a15a-a35614e795fc","year":2025},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.945369Z"},"links":{"cited_paper":"/paper/2503.09941","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:83cb2b3c61747c01a594b0add0cd90cde47874987e9f150c2ddde9de53525b3a","observation_id":"8bf7cc18-b79e-4763-81ca-9f2ffa310c70","resolution":{"observed_at":"2026-08-15T20:34:09.316377Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01144","last_updated":"2017-08-05T22:45:19Z","snapshot_observed_at":"2026-08-15T03:05:41.956181Z","submitted_at":"2016-11-03T19:48:08Z","title":"Categorical Reparameterization with Gumbel-Softmax","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.01144","snapshot_observed_at":"2026-08-15T20:34:08.953656Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.953656Z"},"links":{"cited_paper":"/paper/1611.01144","citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:316f48c32dd496dcd5d48ee1d7cd949aa7af30a3ad03b8c243feba344357905b","observation_id":"036f5936-fb93-4798-abf1-ab8b1a4874ee","resolution":{"observed_at":"2026-08-15T20:34:08.953656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T20:34:09.462389Z","title":"Choosing smartly: Adaptive multimodal fusion for object detection in changing environments","venue":null,"work_id":"5ec22d23-dbda-4513-b333-adabd03142aa","year":2016},"citing_paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T20:34:08.980623Z"},"links":{"citing_paper":"/paper/2505.12693"},"observation_digest":"sha256:88727fdf98a1b8a28683cff51d2a074adb7c3e6d74be92549df9ea30e81b12cc","observation_id":"614b3aa5-b679-4dc6-9cad-1fe3bed072ab","resolution":{"observed_at":"2026-08-15T20:34:09.467719Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.12693","last_updated":"2025-05-19T04:32:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T02:39:14.199401Z","submitted_at":"2025-05-19T04:32:36Z","title":"TACOcc:Target-Adaptive Cross-Modal Fusion with Volume Rendering for 3D Semantic Occupancy"},"reference_resolution":{"displayed":18,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":1,"verified_fuzzy":7},"total_outbound_references":18},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 18 of 18 outbound references and 0 inbound Pith citation observations for arXiv:2505.12693."}