{"as_of":"2026-08-10T00:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b0ef7e487af6fe2520337c47ff774615b55d57facb75093f5f2616ddf7eb4fae","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T17:57:10.303017Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.10408/citation-record","integrity":"/paper/2509.10408/integrity","json":"/paper/2509.10408/citation-record.json","paper":"/paper/2509.10408"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-04T17:57:10.186207Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.186207Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:4576f7786eee1980a8d3621034054d7e7b10360c4156ab04e4224bd539b3d5a7","observation_id":"7a347fee-22db-4bd8-9b08-f49160e3a192","resolution":{"observed_at":"2026-08-04T17:57:10.186207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.189960Z","title":"Muses: The multi- sensor semantic perception dataset for driving un- der uncertainty","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.189960Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:57afc99ef01b675e327ec5954640704078ca39964956d6659996d69d1fd9a8c4","observation_id":"321ea4a8-aa7b-4ba6-a1fc-0a6ff5d5630d","resolution":{"observed_at":"2026-08-04T17:57:10.189960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.192428Z","title":"Cafuser: Condition-aware mul- timodal fusion for robust semantic perception of driving scenes.IEEE Robotics and Automation Letters, 10(4):3134–3141, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.192428Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:dd066ae54ae1c83b3047c8f9689db5f81724245ada63810fe5dccf8b6adbef61","observation_id":"8d2299ab-02ac-4355-99ef-1496ca893c8b","resolution":{"observed_at":"2026-08-04T17:57:10.192428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.195041Z","title":"Collaborative compensative trans- former network for salient object detection.Pattern Recognition, 154:110600, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.195041Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:54aacdc080842a3dc66759db1285b403806857c2a737f285779e7d586129e7fe","observation_id":"b26ff9ed-ab65-4d90-8eec-76772bcc0518","resolution":{"observed_at":"2026-08-04T17:57:10.195041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04579","last_updated":"2024-08-10T11:20:52Z","snapshot_observed_at":"2026-07-06T18:58:30.942582Z","submitted_at":"2024-08-08T16:40:15Z","title":"SAM2-Adapter: Evaluating & Adapting Segment Anything 2 in Downstream Tasks: Camouflage, Shadow, Medical Image Segmentation, and More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04579","snapshot_observed_at":"2026-08-04T17:57:10.197542Z","title":"Sam2-adapter: Evaluating & adapting segment anything 2 in downstream tasks: Camouflage, shadow, medi- cal image segmentation, and more.arXiv preprint arXiv:2408.04579, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.197542Z"},"links":{"cited_paper":"/paper/2408.04579","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:6f04d0d1513f81d820d56c47bd4079540a1bd2ee68d4874c8b3177ab4c2619d7","observation_id":"10b016f4-dd05-416a-99f8-cfe7d4c2ed01","resolution":{"observed_at":"2026-08-04T17:57:10.197542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.200744Z","title":"Sam- adapter: Adapting segment anything in underper- formed scenes","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.200744Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:26eccfde7c2addb3aa632b82515c2f85828ab2bab55aa84717f3bf45c63b6822","observation_id":"ef1c3248-cc62-4eb5-ae67-4aa45eceb3e0","resolution":{"observed_at":"2026-08-04T17:57:10.200744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.203558Z","title":"Vision transformer adapter for dense predictions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.203558Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:5af6d06fe264bafb6d73aced18a895f9aea26bb53d265dc2ae2b9a802060b1fc","observation_id":"2161ec4c-33da-43f1-80c4-97cd035e5390","resolution":{"observed_at":"2026-08-04T17:57:10.203558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.205891Z","title":"Segment any event streams via weighted adaptation of piv- otal tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.205891Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ed0e2d47252ab26d3a153676050049b43364b2ad3724a4ff72369003100f2f54","observation_id":"ffbe9424-33be-486b-b66e-6f15318b9758","resolution":{"observed_at":"2026-08-04T17:57:10.205891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.208028Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.208028Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:38ae39dae686d2b826838202983b0bf8cb08fd506b4f5e72722f8c353ffcc83e","observation_id":"8c9c4d75-18c7-40d4-a1c8-5299140f9a16","resolution":{"observed_at":"2026-08-04T17:57:10.208028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.210287Z","title":"Schwing, and Alexander Kirillov","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.210287Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:666ae2128b91edf5209be3b03de2d15ae0140f1ad812bedb596da0f28bec2df4","observation_id":"9587c8bd-cda9-4193-b365-0ce82db1a7d1","resolution":{"observed_at":"2026-08-04T17:57:10.210287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.212417Z","title":"The cityscapes dataset for semantic urban scene understanding.2016 IEEE Conference on Computer Vision and Pattern Recognition (CVPR), pages 3213–3223, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.212417Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ec95362b7997ef6a79089477150e842e07c19d6ddd4da3b186d7aae1d1636621","observation_id":"4ff29033-4b1c-49c1-bb6b-7118102e7bfe","resolution":{"observed_at":"2026-08-04T17:57:10.212417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1301.3572","last_updated":"2013-03-14T18:18:17Z","snapshot_observed_at":"2026-08-03T15:16:21.495472Z","submitted_at":"2013-01-16T03:31:30Z","title":"Indoor Semantic Segmentation using depth information","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1301.3572","snapshot_observed_at":"2026-08-04T17:57:10.214744Z","title":"Indoor semantic seg- mentation using depth information.arXiv preprint arXiv:1301.3572, 2013","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.214744Z"},"links":{"cited_paper":"/paper/1301.3572","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:d0b747b95cfccfad77c301d8a05177181765ab765f5881eb7d58669c7ca36a42","observation_id":"6e0a3a0e-2d4f-4290-9ec7-9f7e61785b99","resolution":{"observed_at":"2026-08-04T17:57:10.214744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.217238Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.217238Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ab94f9524138b742dd605658fee25f7174a0ab432bfada2f8b50726b8d941a1e","observation_id":"14aa2558-9aad-4a5a-b0b4-4da990cd9c00","resolution":{"observed_at":"2026-08-04T17:57:10.217238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00360","last_updated":"2023-12-04T04:38:17Z","snapshot_observed_at":"2026-07-06T16:55:29.501535Z","submitted_at":"2023-12-01T05:50:44Z","title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00360","snapshot_observed_at":"2026-08-04T17:57:10.219394Z","title":"Efficient multimodal semantic segmentation via dual-prompt learning.arXiv preprint arXiv:2312.00360, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.219394Z"},"links":{"cited_paper":"/paper/2312.00360","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:0ae937341e249d35477c912ae8b1125f10963ad8ff9e6a79bf2b30810d13950f","observation_id":"afa845c1-4515-4aef-a7e1-0fb2a2eac19c","resolution":{"observed_at":"2026-08-04T17:57:10.219394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.221729Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.221729Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:d09fcfed144a8d31c1ffadf97a0aeddcb9d8c4595d4bf10456bd11e6a55077d3","observation_id":"24009656-2c0f-42c1-ae18-1aaeb7b35a1e","resolution":{"observed_at":"2026-08-04T17:57:10.221729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.223935Z","title":"Mfnet: Towards real-time semantic segmentation for au- tonomous vehicles with multi-spectral scenes","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.223935Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:8b03fa62f7fcdc9a5b744c74f28aeee8edeed7596948d4f35089518c20f90576","observation_id":"d4ffa69b-a290-4283-8e8a-afb9eea561ea","resolution":{"observed_at":"2026-08-04T17:57:10.223935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.226067Z","title":"A survey on instance segmentation: state of the art","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.226067Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:2a92b0a4034c7306802ffec54cfc50f89bec31c174f1de61ff0ec603d4df0d46","observation_id":"5af5a4f5-2dd9-4ee7-9551-fc2f0b2ac079","resolution":{"observed_at":"2026-08-04T17:57:10.226067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.228255Z","title":"Fusenet: Incorporating depth into semantic segmentation via fusion-based cnn architecture","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.228255Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:2f5c3939a659d3a954210bf893fba47e58c4803d4c773beada24ed5f52a3905d","observation_id":"6e8a6288-2c2d-4e71-9f30-7910b71dabe2","resolution":{"observed_at":"2026-08-04T17:57:10.228255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.230271Z","title":"Masked au- toencoders are scalable vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.230271Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:39e29578c28ce014205870385139d48b274d4e99b2225b44265fac3d7bf2f58c","observation_id":"01bcface-043d-41b7-b0fa-1fc4fa44f862","resolution":{"observed_at":"2026-08-04T17:57:10.230271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.232394Z","title":"Parameter-efficient transfer learning for NLP","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.232394Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:0fbfba3cccec03adbb60e9b0f6f8d361ecc6213fd17c07b1c76f7322a375ab06","observation_id":"5b6c5c2f-fa9d-4b74-8902-b85958b2699d","resolution":{"observed_at":"2026-08-04T17:57:10.232394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.234871Z","title":"Lora: Low-rank adaptation of large language models.ICLR, 1(2):3, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.234871Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:cea9779ae0130985e07071b0eb763b29f8f40400e54f7be4d43f934f3cbae260","observation_id":"7805319b-164c-4085-8c3d-e8adddebd491","resolution":{"observed_at":"2026-08-04T17:57:10.234871Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.237025Z","title":"Roadformer+: Delivering rgb-x scene parsing through scale-aware information decou- pling and advanced heterogeneous feature fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.237025Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ade573cb4de94af82d37f8466ea2dd99d80deadfc861e22bc59b0d18acaf1ea5","observation_id":"8f1a1af5-46f5-4160-aba9-c778f5cca0ee","resolution":{"observed_at":"2026-08-04T17:57:10.237025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.239078Z","title":"OneFormer: One Transformer to Rule Universal Image Segmenta- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.239078Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:271dd17ffe3778fb8d1c31bb05426c56ab087eef46b371893d63c02c9f533bc4","observation_id":"c52c5a3c-426e-4b1d-a1b9-785491ca7b29","resolution":{"observed_at":"2026-08-04T17:57:10.239078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.241304Z","title":"Gemini- Fusion: Efficient pixel-wise multimodal fusion for vision transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.241304Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:f01839f6b3cb9154165ea7ac22ecd87f4a0fbfeea33c45c1359c24693fd76972","observation_id":"dbb802b1-44af-4d7a-b472-6ac5f4943948","resolution":{"observed_at":"2026-08-04T17:57:10.241304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.243502Z","title":"Attention enhanced machine instinctive vision with human-inspired saliency detection.Image and Vision Computing, 152:105308, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.243502Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:53e431f474b8819722ef7008736622fee6bab843d744188f369dedbefadd4d3d","observation_id":"c63e47d3-4580-448f-b9bb-c545acac4d55","resolution":{"observed_at":"2026-08-04T17:57:10.243502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.245592Z","title":"Berg, Wan-Yen Lo, Piotr Dollar, and Ross Gir- shick","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.245592Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:bb3f0b2f536488f62db4aa472a243fc642efa2881488509d4494bdd31341e2de","observation_id":"13a48c4b-9b69-475e-b3fb-cf79660adc78","resolution":{"observed_at":"2026-08-04T17:57:10.245592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01343","last_updated":"2025-08-07T03:50:19Z","snapshot_observed_at":"2026-07-06T18:56:09.984719Z","submitted_at":"2024-08-02T15:41:16Z","title":"StitchFusion: Weaving Any Visual Modalities to Enhance Multimodal Semantic Segmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01343","snapshot_observed_at":"2026-08-04T17:57:10.247701Z","title":"Stitchfusion: Weaving any vi- sual modalities to enhance multimodal semantic segmentation.arXiv preprint arXiv:2408.01343, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.247701Z"},"links":{"cited_paper":"/paper/2408.01343","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:1b8b2fc4c4eec6b4787b76e3663b365878f1a500a03eb67255207c0be6c713ed","observation_id":"bff41114-5f22-4ec9-bd92-f5d60a20d825","resolution":{"observed_at":"2026-08-04T17:57:10.247701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.250484Z","title":"Roadformer: Duplex transformer for rgb-normal semantic road scene parsing.IEEE Transactions on Intelligent Vehicles, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.250484Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ddaba4b2520dd58aa4a3d1a8a9d7ffb79be57119eeea02384054753b04c6ad9c","observation_id":"10295fea-fd74-43cf-9b98-a0bfe513a6f1","resolution":{"observed_at":"2026-08-04T17:57:10.250484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.252838Z","title":"Multi-interactive feature learning and a full- time multi-modality benchmark for image fusion and segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.252838Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:536878b31f31db8e3d4f88c31063f81d6865e88a3a37659269d9829be77ec853","observation_id":"5287e19c-3f4c-42aa-8e6d-c9397b8c784e","resolution":{"observed_at":"2026-08-04T17:57:10.252838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.255063Z","title":"Segmenting anything in the dark via depth perception.IEEE Transactions on Multime- dia, pages 1–12, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.255063Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:a1d8afe247e35bef2681b653b0e1df85e1d1f85138270282e530516e02d2b6a8","observation_id":"2ffc6ece-79bf-48fd-a552-5ceb07405b8e","resolution":{"observed_at":"2026-08-04T17:57:10.255063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.257218Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.257218Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:4043c84be4ddcd56bb892d1b50f8fa0434ff795ee4324211ec85682ba1de4a62","observation_id":"c5fea37f-8238-43df-aa41-f3988d9643af","resolution":{"observed_at":"2026-08-04T17:57:10.257218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.259399Z","title":"A convnet for the 2020s.Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.259399Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:c6e632d90878e4833c69476009ad6dceb3bbb05956cf94020b2836b1c3f4a822","observation_id":"5992e257-fcb6-49f8-8eb5-100c7c6567e3","resolution":{"observed_at":"2026-08-04T17:57:10.259399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.261526Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.261526Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ad22eac08fdf2ff914296a3817ec7557c6cf871a29e20bce8cfb9d2eac33c09a","observation_id":"c126f55d-efe6-4849-b253-45b5d7c9c018","resolution":{"observed_at":"2026-08-04T17:57:10.261526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.263645Z","title":"Image segmentation using deep learn- ing: A survey.IEEE transactions on pattern anal- ysis and machine intelligence, 44(7):3523–3542, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.263645Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:d8c71f66395deb756f87a285f7a9fc571657f59df37d65ecf61d8344a1b6ea9d","observation_id":"2d1f97ab-94f3-4564-848e-9ba6dcd619ad","resolution":{"observed_at":"2026-08-04T17:57:10.263645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.265986Z","title":"SAM 2: Segment any- thing in images and videos","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.265986Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:ed4b41ba784da1f89042605385a95202e18d026171bfc8b88c9dcdf8cfac26d9","observation_id":"f9264136-54ee-45f1-a977-77d6d5f7c882","resolution":{"observed_at":"2026-08-04T17:57:10.265986Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17803","last_updated":"2024-07-29T08:43:48Z","snapshot_observed_at":"2026-08-04T03:07:12.862709Z","submitted_at":"2024-01-31T12:53:11Z","title":"SU-SAM: A Simple Unified Framework for Adapting Segment Anything Model in Underperformed Scenes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17803","snapshot_observed_at":"2026-08-04T17:57:10.268219Z","title":"Su-sam: A simple unified framework for adapting segment anything model in underperformed scenes.arXiv preprint arXiv:2401.17803, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.268219Z"},"links":{"cited_paper":"/paper/2401.17803","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:1e6d9f8f044363397c6f420c0cbd40a9949d40dee43a230e93d048beb3fbaee1","observation_id":"32733f63-bd37-4c62-b959-6b3275abae41","resolution":{"observed_at":"2026-08-04T17:57:10.268219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.270722Z","title":"Rtfnet: Rgb-thermal fusion network for semantic segmen- tation of urban scenes.IEEE Robotics and Au- tomation Letters, 4(3):2576–2583, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.270722Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:6872de35cf1aba9b8af37f758b8babb993552c1b9d06edbba355d301b0e1d8ec","observation_id":"fc436ae8-5d0b-4d19-bcaf-486117b5da63","resolution":{"observed_at":"2026-08-04T17:57:10.270722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.272981Z","title":"Semantic segmentation using vision transformers: A survey","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.272981Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:1aee140bb2a6d225b18b2f8833078ce2843b1bc5bbe9bb217cb85065c0e5130b","observation_id":"230a0912-8149-4038-a4b9-d6d09373d600","resolution":{"observed_at":"2026-08-04T17:57:10.272981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15063","last_updated":"2024-11-12T14:29:09Z","snapshot_observed_at":"2026-07-06T19:06:37.442341Z","submitted_at":"2024-08-27T13:47:31Z","title":"Adapting Segment Anything Model to Multi-modal Salient Object Detection with Semantic Feature Fusion Guidance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15063","snapshot_observed_at":"2026-08-04T17:57:10.275121Z","title":"Adapting seg- ment anything model to multi-modal salient object detection with semantic feature fusion guidance","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.275121Z"},"links":{"cited_paper":"/paper/2408.15063","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:a2ae4de0cee5f6065258d8f1d167c71d5910669c08df637fe81de1fd9b6f965c","observation_id":"2082cd3f-be90-465e-84f5-8346df53bdd3","resolution":{"observed_at":"2026-08-04T17:57:10.275121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.277486Z","title":"Multi- modal token fusion for vision transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.277486Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:37bb07705dfa8ef976dd95fc6ed3ebcec4fc3b4883c7d17699267ccfb978507c","observation_id":"834e7e1b-6041-4db0-a64c-9c8b88137669","resolution":{"observed_at":"2026-08-04T17:57:10.277486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12620","last_updated":"2023-12-29T03:40:59Z","snapshot_observed_at":"2026-07-06T15:19:39.223171Z","submitted_at":"2023-04-25T07:34:22Z","title":"Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12620","snapshot_observed_at":"2026-08-04T17:57:10.279609Z","title":"Medical sam adapter: Adapting segment anything model for medical image segmentation.arXiv preprint arXiv:2304.12620, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.279609Z"},"links":{"cited_paper":"/paper/2304.12620","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:346aadcb0dc0bee43652547ec4a0a80f60b9206a4ccee1c18228babb49b61d10","observation_id":"e11ff524-d44d-4b46-b372-17654bd44545","resolution":{"observed_at":"2026-08-04T17:57:10.279609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09085","last_updated":"2024-08-17T03:45:40Z","snapshot_observed_at":"2026-08-06T16:47:45.298875Z","submitted_at":"2024-08-17T03:45:40Z","title":"Segment Anything with Multiple Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09085","snapshot_observed_at":"2026-08-04T17:57:10.281980Z","title":"Segment any- thing with multiple modalities.arXiv preprint arXiv:2408.09085, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.281980Z"},"links":{"cited_paper":"/paper/2408.09085","citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:89a4e773ed3b00f110a03bca6e1a383ce12e9bf1aae837be8caf4f5a3b88a001","observation_id":"0679f528-db9c-4605-b29c-069c9e0a19ba","resolution":{"observed_at":"2026-08-04T17:57:10.281980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.284408Z","title":"Seg- former: Simple and efficient design for semantic segmentation with transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.284408Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:7575507282877b85a4aa7f7a764d550d2622456f91cd5a46e3cfc2530ca9add2","observation_id":"56391f36-4c52-4d92-a294-5cfd60b7218b","resolution":{"observed_at":"2026-08-04T17:57:10.284408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.287014Z","title":"Parameter-efficient fine-tuning for pre- trained vision models: A survey.arXiv preprint arXiv:2402.02242, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.287014Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:24075a5161bb9d825f6d078a692c2543e901dbf19d4516230666863169a3c414","observation_id":"22e54170-aa7d-43a2-9e10-e363942b4729","resolution":{"observed_at":"2026-08-04T17:57:10.287014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.289144Z","title":"Sam-event-adapter: Adapting segment anything model for event-rgb se- mantic segmentation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.289144Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:9cf231bc7fd68b4cd77ed2670ec133a45cee8d3a3e281ae2881b77f9f1c08c83","observation_id":"e72d7695-c7bd-40df-9a41-d37a777a0e66","resolution":{"observed_at":"2026-08-04T17:57:10.289144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.291313Z","title":"Zeiler, Dilip Krishnan, Geoffrey W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.291313Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:04dd4bc02ffcfb0c0759da03aea62b5cedc55dd044da5f9a768dc2d8e9059ef8","observation_id":"e7fa07fc-aeb5-4860-ae5d-b375f634f202","resolution":{"observed_at":"2026-08-04T17:57:10.291313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.294088Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmen- tation with transformers.IEEE Transactions on Intelligent Transportation Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.294088Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:4a3efe8f69d35b904201c9244e0922010978aa105c24cd54af34bab692967f4b","observation_id":"9a39c179-554c-4663-8330-f54d22db7bae","resolution":{"observed_at":"2026-08-04T17:57:10.294088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.296256Z","title":"Delivering arbitrary-modal semantic segmentation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.296256Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:555b226c5ae55f1ec433f94e47434325bf0f07f8e835ca20c06c8015267a432e","observation_id":"1a73dad3-2c41-4073-afdc-9abc20864828","resolution":{"observed_at":"2026-08-04T17:57:10.296256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.298400Z","title":"Deep multimodal fusion for semantic image segmentation: A survey.Image and Vision Computing, 105:104042, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.298400Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:c1d3d16341e652bb382d293dfddecc06c98333cf6f3151535efe0c4be10b5f70","observation_id":"749ab53f-542a-47d8-a558-4616d11995ab","resolution":{"observed_at":"2026-08-04T17:57:10.298400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.300803Z","title":"Deformable{detr}: Deformable transformers for end-to-end object de- tection","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.300803Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:991c89fe6769ca8f496b08b6d8162ec75ef98c99a1096aac94749618b1084dea","observation_id":"4b1635b9-56b0-4d54-be00-68dd0d04c5c0","resolution":{"observed_at":"2026-08-04T17:57:10.300803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T17:57:10.303017Z","title":"Segment everything every- where all at once.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T17:57:10.303017Z"},"links":{"citing_paper":"/paper/2509.10408"},"observation_digest":"sha256:eece834b1acc2f8985680818afaf53a3185e3e57237caf6629041b07e1446e23","observation_id":"77138987-85c1-44ac-9295-184ca60b8ac8","resolution":{"observed_at":"2026-08-04T17:57:10.303017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.10408","last_updated":"2025-09-12T16:58:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-04T17:57:09.327441Z","submitted_at":"2025-09-12T16:58:51Z","title":"Multimodal SAM-adapter for Semantic Segmentation"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":51,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2509.10408."}