{"as_of":"2026-08-09T10:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1b543b85956b0834cd1f123b88812ea04344ef16d6cc5f93489eff1f25340201","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:19:35.184809Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02092/citation-record","integrity":"/paper/2608.02092/integrity","json":"/paper/2608.02092/citation-record.json","paper":"/paper/2608.02092"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:29.274812Z","title":"Transfusion: Robust lidar-camera fusion for 3d object detection with transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:29.274812Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:abc2b0211acccb77324dcb605335991d4732ede24ff7e4257660e025e777aa11","observation_id":"2fc8c1b8-7bd8-4006-9a07-d46cea440b09","resolution":{"observed_at":"2026-08-04T15:19:29.274812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-04T15:19:29.544836Z","title":"Estimating or propagat- ing gradients through stochastic neurons for conditional computation.arXiv preprint arXiv:1308.3432, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:29.544836Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:6d0f93dec89ff1a14a45ab9a8c5040fd68a0b123b757c3789fd8bf2e85c765d5","observation_id":"eeca9655-7a62-49c1-9f18-1fe30ca31e35","resolution":{"observed_at":"2026-08-04T15:19:29.544836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10934","last_updated":"2020-04-23T02:10:02Z","snapshot_observed_at":"2026-07-06T09:14:32.318388Z","submitted_at":"2020-04-23T02:10:02Z","title":"YOLOv4: Optimal Speed and Accuracy of Object Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10934","snapshot_observed_at":"2026-08-04T15:19:29.745768Z","title":"Yolov4: Optimal speed and accuracy of object detection.arXiv preprint arXiv:2004.10934, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:29.745768Z"},"links":{"cited_paper":"/paper/2004.10934","citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:85f33559c3a1ac69bc01233ce31d44d52d0a34163e4e38342625d74bb212d156","observation_id":"c72745d5-e7d5-42a3-858b-ce3ce0d7b185","resolution":{"observed_at":"2026-08-04T15:19:29.745768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:29.945953Z","title":"End-to-end object detection with transformers","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:29.945953Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:cc402fc4c9a1cd18c5aa235a54037b8689edb549f1861d75c2e137d6399ea77d","observation_id":"578563e1-53b0-4726-aac2-51d5cb5c03d5","resolution":{"observed_at":"2026-08-04T15:19:29.945953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:30.124807Z","title":"Weakly misalignment-free adaptive feature alignment for uavs-based multi- modal object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:30.124807Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:a270cc3ae7dbb238d165555f8e6781f3856c6dff2d088412baca70fa95dad3b8","observation_id":"25b6662d-a520-4989-80f8-5d159fdee546","resolution":{"observed_at":"2026-08-04T15:19:30.124807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:30.245774Z","title":"Slbaf-net: Super-lightweight bimodal adaptive fusion network for uav detection in low recognition environment.Multimedia Tools and Applications, 82(30):47773–47792, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:30.245774Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:99e381f7ef401b96be165a63000632181541849898d9f3c80c74595f1cefd285","observation_id":"d048fc71-c512-49ba-9b14-3835c326ca44","resolution":{"observed_at":"2026-08-04T15:19:30.245774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:30.468275Z","title":"Fusion-mamba for cross-modality object detection.IEEE Transactions on Multimedia, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:30.468275Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:1f1a5fc5a78485d649a06a63e5057e5300634c4d6528b6de4e43a6a198fd7a09","observation_id":"904d2e6b-5c15-443b-b03b-12abf83e3f59","resolution":{"observed_at":"2026-08-04T15:19:30.468275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00273","last_updated":"2022-10-04T09:52:39Z","snapshot_observed_at":"2026-07-06T12:03:45.415112Z","submitted_at":"2021-10-30T15:34:12Z","title":"Cross-Modality Fusion Transformer for Multispectral Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00273","snapshot_observed_at":"2026-08-04T15:19:30.641745Z","title":"Cross-modality fusion transformer for multispectral object detection.arXiv preprint arXiv:2111.00273, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:30.641745Z"},"links":{"cited_paper":"/paper/2111.00273","citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:5690e83afbab8b2d46489859df6e94eaf44c30fe1254340b115f31b229295ab5","observation_id":"e2a22f0f-56b0-4d48-8767-6f75167a6eb1","resolution":{"observed_at":"2026-08-04T15:19:30.641745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:30.814799Z","title":"Ob- ject detection in thermal spectrum for advanced driver-assistance systems (adas).Ieee Access, 9:156465–156481, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:30.814799Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:26fbd81b2e4148fb5aa729554a75f3d184a0fb94c2dbf31d93347940ffa907d4","observation_id":"ba90d761-14ea-45f3-9c68-3b90a9e1824a","resolution":{"observed_at":"2026-08-04T15:19:30.814799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:30.924735Z","title":"Lraf-net: Long-range attention fusion network for visible–infrared object detection.IEEE Transactions on Neural Networks and Learning Systems, 35 (10):13232–13245, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:30.924735Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:665ce483116a5fd794aae1af1ebb67e8271be87d18e9c7cffcb6c7f85c08aaf9","observation_id":"9a20d8af-50d9-44e7-8c23-916425b37a42","resolution":{"observed_at":"2026-08-04T15:19:30.924735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:31.054823Z","title":"Multi- spectral pedestrian detection: Benchmark dataset and baseline","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:31.054823Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:19caab88ceb49623926de42909adaebf72d51c7c9a7f5a8b52e82ebcc7835c96","observation_id":"63db0106-dabd-4785-ab97-ed813c6a1277","resolution":{"observed_at":"2026-08-04T15:19:31.054823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:31.197468Z","title":"A review on methods and applications in multimodal deep learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:31.197468Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:b6610db321c16ca3f9db3921dbeb7a50596d9e2f667091b460ee5f194f90f33f","observation_id":"bd14c166-722e-4af3-a4ab-1482566a994b","resolution":{"observed_at":"2026-08-04T15:19:31.197468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:31.480686Z","title":"Mul- tispectral object detection enhanced by cross-modal information complementary and cosine similarity channel resampling modules","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:31.480686Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:9d20c8830aea933f910cfacf6f926fcd4c8d47cebc9127ee934722937087edab","observation_id":"57ec474d-77ad-47a7-b81e-90d46e15310b","resolution":{"observed_at":"2026-08-04T15:19:31.480686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:31.640245Z","title":"Llvip: A visible- infrared paired dataset for low-light vision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:31.640245Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:991b2e65b20b10f14280b63ef44b0587a268ea86cfccd8a4aaad5a05be42de7c","observation_id":"30cb16e4-c1f8-4864-8ad2-1258703c7b9f","resolution":{"observed_at":"2026-08-04T15:19:31.640245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:31.884978Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:31.884978Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:5032d8ad127c906067bfe0c50da9f4c2059b8d3ac7308348df6e047eef0c5af0","observation_id":"3b0f82bc-c41a-4b51-904e-39089dd7ca79","resolution":{"observed_at":"2026-08-04T15:19:31.884978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.044893Z","title":"Ultralytics yolo, January 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.044893Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:7b45ece1d3fcdcdeb79ec52fd5028677c48191c771513ac5c68f3765d7a7fa3a","observation_id":"2d148f51-a78c-4e02-8124-1854fc32c8e9","resolution":{"observed_at":"2026-08-04T15:19:32.044893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.229151Z","title":"ultralytics/YOLOv5: v6.0, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.229151Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:f20e2090a94c5bbf9c0471c32eed83347e68655b6558e0a8ea987fc5fb3dcaea","observation_id":"41b75c3d-8820-46b8-9991-35f5159d854d","resolution":{"observed_at":"2026-08-04T15:19:32.229151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.315138Z","title":"Densefuse: A fusion approach to infrared and visible images","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.315138Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:4294c5b2d873a76968057db8d6ddac622edbd0c027354aa709b15fb98fa2d6e7","observation_id":"6427830a-0a40-4669-a609-551a3d6da36f","resolution":{"observed_at":"2026-08-04T15:19:32.315138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.424748Z","title":"Crossfuse: A novel cross attention mechanism based infrared and visible image fusion approach.Information Fusion, 103:102147, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.424748Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:071302acb89704f40feee6f7f05149c7df354074e0e14c252324cbbef1002c05","observation_id":"b5708581-be2f-4058-b8ce-61dd0fc52245","resolution":{"observed_at":"2026-08-04T15:19:32.424748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.545857Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.545857Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:c0a8da9d628a4910de35c1c47caf50b50917e4dc7356699d8799a6dcb9c46584","observation_id":"936376de-48f1-4169-ad58-4d25134b8f8b","resolution":{"observed_at":"2026-08-04T15:19:32.545857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.782279Z","title":"Target-aware dual adversarial learning and a multi-scenario multi- modality benchmark to fuse infrared and visible for object detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.782279Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:00105643dd2401a304cc5f5ebc8734e81c77f99b95f01403419837d2c76db8cd","observation_id":"57f67b48-0372-4295-b858-0cc4176a482e","resolution":{"observed_at":"2026-08-04T15:19:32.782279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:32.932533Z","title":"Infrared and visible image fusion methods and applications: A survey.Information fusion, 45:153–178, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:32.932533Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:e57aac817478238eedef421467f51dced901487c48afa784ec8de48a3775594b","observation_id":"62563498-81bf-4c9e-8410-c7b4a1547cc1","resolution":{"observed_at":"2026-08-04T15:19:32.932533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.054830Z","title":"Swinfu- sion: Cross-domain long-range learning for general image fusion via swin transformer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.054830Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:380386d22ea0ee839aa480562369340671b4aecbdd3987b99ad1daf19ce8440b","observation_id":"6ca0e3d0-45cf-44b1-8793-d3ca66ea8d73","resolution":{"observed_at":"2026-08-04T15:19:33.054830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.144809Z","title":"Sparse sequence-to-sequence mod- els","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.144809Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:d29459d6bca032f9c1ccfa6bcce8264bc4e2207fb95af595addd24d1f0f0eb18","observation_id":"13e23233-9693-4abb-a40c-d6d9c5876386","resolution":{"observed_at":"2026-08-04T15:19:33.144809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.243348Z","title":"Cross-modality attentive feature fusion for object detection in multispectral remote sensing imagery.Pattern Recognition, 130:108786, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.243348Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:20c4a3820f39716865ef0d3a4d8e44f5924ec5851ffc43c873b49048d7ed348c","observation_id":"4b1c2a55-1859-452b-9e11-75799b6b88f5","resolution":{"observed_at":"2026-08-04T15:19:33.243348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.364740Z","title":"Vehicle detection in aerial imagery: A small target detection benchmark.Journal of Visual Communication and Image Rep- resentation, 34:187–203, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.364740Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:3edb9f340f0b973604c12059eaff5bcf8d824126cf8f49d8fa2dd79d2a50d950","observation_id":"9c67d0f6-d43c-4f64-8451-66df09fa7c0a","resolution":{"observed_at":"2026-08-04T15:19:33.364740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.444735Z","title":"Icafusion: It- erative cross-attention guided feature fusion for multispectral object detection.Pattern Recognition, 145:109913, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.444735Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:b47f63311a098b44558fb4937beacc3a5f5e4388bf9bfa1a5177e8f453744830","observation_id":"7558bfce-6624-4b63-a7e4-1bd53475ddd5","resolution":{"observed_at":"2026-08-04T15:19:33.444735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.604870Z","title":"Dropout: a simple way to prevent neural networks from overfitting","venue":null,"work_id":null,"year":1929},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.604870Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:171758a12877656ffa7a58f9346095eb290646a75ef55bea311dab9b0e065737","observation_id":"288bf3ba-b5c7-4fc7-9699-0b514146b890","resolution":{"observed_at":"2026-08-04T15:19:33.604870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:33.794899Z","title":"Adaptive multimodal feature fusion with fre- quency domain gate for remote sensing object detection.Remote Sensing Letters, 15 (2):133–144, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:33.794899Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:a097975fe97e2cdb9211f7b6b9aa5d5fe2e964009dc1d72cfd8280d857d4e261","observation_id":"a307ffb5-2b0b-4998-9f1d-3ff9340345d7","resolution":{"observed_at":"2026-08-04T15:19:33.794899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.004816Z","title":"Drone-based rgb-infrared cross- modality vehicle detection via uncertainty-aware learning.IEEE Transactions on Cir- cuits and Systems for Video Technology, 32(10):6700–6713, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.004816Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:828af623bb658246a157e56c3d5fe18803b293c1f52fec707f18902ed6292643","observation_id":"536bb4ea-a60c-46a3-ad1a-89986acd7e0a","resolution":{"observed_at":"2026-08-04T15:19:34.004816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.205131Z","title":"Deep multimodal fusion by channel exchanging.Advances in neural infor- mation processing systems, 33:4835–4845, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.205131Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:89a08e913f8d71edb968f2621bea20bf169258734ca8f345bfd663c07aa6645e","observation_id":"191e0bea-9db0-4846-9835-92a0086986c1","resolution":{"observed_at":"2026-08-04T15:19:34.205131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.355110Z","title":"Cdc-yolofusion: Leveraging cross-scale dynamic convolution fusion for visible-infrared object detec- tion.IEEE Transactions on Intelligent V ehicles, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.355110Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:017eb838b9a7583903e4e07fcf846e4269968804e727ef17d5e08bbf9f34c9c5","observation_id":"25ed09ea-2ac6-425c-831d-f50a0a58b1ac","resolution":{"observed_at":"2026-08-04T15:19:34.355110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.464733Z","title":"If-usod: Multimodal information fusion interactive feature enhancement architecture for underwater salient object detection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.464733Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:c9fc295c7f2e395445bbd78a13820b0ce197c237c20b23ca155c4745f1db6b74","observation_id":"fec75606-8a8d-4f58-9503-c49df7da16e1","resolution":{"observed_at":"2026-08-04T15:19:34.464733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.604813Z","title":"Translation, scale and rotation: cross- modal alignment meets rgb-infrared vehicle detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.604813Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:15ed00bc338c1c06d750d6d65042692a955c69aa9d9dd1f64d6bfcde1744a04f","observation_id":"23b41c61-c045-44c7-b345-343b11ac27c8","resolution":{"observed_at":"2026-08-04T15:19:34.604813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.722705Z","title":"Cutmix: Regularization strategy to train strong classifiers with local- izable features","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.722705Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:54cb7606958bc5a097ca2b57371a19101c47fa9f2b909e3719133365ec28f15c","observation_id":"85d0e79d-3e6a-4708-b97f-5253ba1ea24d","resolution":{"observed_at":"2026-08-04T15:19:34.722705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:34.854927Z","title":"Guided attentive feature fusion for multispectral pedestrian detection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:34.854927Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:a51f59589864f097273686c169099996bcfef551fefba4fe3504becd9e61adb2","observation_id":"62a43ed5-ab8f-4bda-84f6-f91b8213a9b7","resolution":{"observed_at":"2026-08-04T15:19:34.854927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:35.015144Z","title":"Weakly aligned cross-modal learning for multispectral pedestrian detection","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:35.015144Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:47808696bc5de7b490e8bf7040a498b26f70578340c6166a472b01d68e556021","observation_id":"61800101-508d-4888-abfa-e4beb737620f","resolution":{"observed_at":"2026-08-04T15:19:35.015144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:35.184809Z","title":"Cddfuse: Correlation-driven dual-branch feature decom- position for multi-modality image fusion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:35.184809Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:2be846e9b5d90640c7705c3a71bc3bf2edd6375f9ffee96c75b2ad14954574d9","observation_id":"1c208c05-faf9-407c-a200-98e0f20f547e","resolution":{"observed_at":"2026-08-04T15:19:35.184809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:19:31.364748Z","title":"URLhttps://doi.org/10.1145/3545572","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion","version":1},"reference_index":6857,"source":"pdf_text","source_observed_at":"2026-08-04T15:19:31.364748Z"},"links":{"citing_paper":"/paper/2608.02092"},"observation_digest":"sha256:02909bc97c9d0c75606c1b675c57009d6569963bb8333837c30384ec7d268176","observation_id":"759259af-0bec-47a7-8e66-8118e2081883","resolution":{"observed_at":"2026-08-04T15:19:31.364748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02092","last_updated":"2026-08-03T11:51:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T18:22:16.180272Z","submitted_at":"2026-08-03T11:51:12Z","title":"Deep Multimodal Fusion Detection through Spatial Mask and Channel Fusion"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2608.02092."}