{"as_of":"2026-08-20T22:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:060dc649a5c0bbe84b195e6408ed6b6a1503c745506be4769aca18ceab35d3d9","coverage":[{"denominator":111,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T11:11:44.115214Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.18669/citation-record","integrity":"/paper/2411.18669/integrity","json":"/paper/2411.18669/citation-record.json","paper":"/paper/2411.18669"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.637794Z","title":"Sequential modeling enables scalable learning for large vision models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.637794Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:3af12b22af5ad6ee53c9c8d076fef9b5a4d4aef23f0cda4a5fc9d731c15eb64d","observation_id":"34ed44b5-4471-49d2-ae87-3d4a94cd94db","resolution":{"observed_at":"2026-08-12T11:11:43.637794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.642808Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.642808Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:eefa5b3619f7f6b525d5bdf9bd44f9524b07ec02dfb06a5442eed55438184b73","observation_id":"20e2c845-7037-4c58-b29c-45b40b9db29e","resolution":{"observed_at":"2026-08-12T11:11:43.642808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-12T11:11:43.647539Z","title":"On the opportunities and risks of foundation models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.647539Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:075e80206313a814e2cf0478678fb64029888e6818083a640a2a2678e2eb7e60","observation_id":"bb5963a4-2dab-4b91-af83-d7bf7352569c","resolution":{"observed_at":"2026-08-12T11:11:43.647539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.653165Z","title":"Multi-spectral sift for scene category recognition","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.653165Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:685aa6fbc56c27c4f1454483fe20dbacd76e73e53f292a54e4026b421d893d8f","observation_id":"c9e98013-8d77-4fa5-bd65-815532dbb8dd","resolution":{"observed_at":"2026-08-12T11:11:43.653165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.658190Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.658190Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:5b3720d05be59b40a2c71936ced4658ef27a2411d5241087b8faf2fe9c73a17d","observation_id":"196e969f-6053-4630-8cc3-6c2273aad0a4","resolution":{"observed_at":"2026-08-12T11:11:43.658190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.663163Z","title":"Pretrainable geometric graph neural network for antibody affinity maturation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.663163Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:ecfb7516f75d013d457318d6a9ccd946c64b7ce83b65db163c0147a91ac54184","observation_id":"5608ce74-84a7-4f4f-af2e-35de469167f0","resolution":{"observed_at":"2026-08-12T11:11:43.663163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14207","last_updated":"2023-05-23T16:26:56Z","snapshot_observed_at":"2026-08-17T15:34:56.969343Z","submitted_at":"2023-05-23T16:26:56Z","title":"SAD: Segment Any RGBD","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14207","snapshot_observed_at":"2026-08-12T11:11:43.668630Z","title":"Sad: Segment any rgbd","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.668630Z"},"links":{"cited_paper":"/paper/2305.14207","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:94fd79658482a9c93471e763743c81a555a16d51fc990fab85b461a0d37bd3e8","observation_id":"16c01c81-68b3-454b-8070-91fff15ebcfa","resolution":{"observed_at":"2026-08-12T11:11:43.668630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.673641Z","title":"Hts-at: A hierarchical token-semantic audio transformer for sound classification and detection","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.673641Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:fbeba6b7509ff5ff4b01b18ee0aebac0aee993bce96ef43591e7a8723638d2c4","observation_id":"af42e5b3-6fee-47b8-ad3f-d326585129a1","resolution":{"observed_at":"2026-08-12T11:11:43.673641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.678256Z","title":"Domain ad- aptation for semantic segmentation with maximum squares loss","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.678256Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:c8e7d864a3425b66e7f0f88ccaa9e31067ee3d385a1d8062862784df1b2fd340","observation_id":"7771db4a-236a-438a-9878-2811fc1a62f9","resolution":{"observed_at":"2026-08-12T11:11:43.678256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.682832Z","title":"Adaptformer: Ad- apting vision transformers for scalable visual recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.682832Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:ef5739b4d2257f6a4435cf79e8529b4e9a2ea06d3fba0a9328f75afcea3c0484","observation_id":"cc6bf476-9401-4b14-af7a-f53bee9d0c0c","resolution":{"observed_at":"2026-08-12T11:11:43.682832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.687845Z","title":"A simple framework for contrastive learn- ing of visual representations","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.687845Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:b8df781a7150d96171b149a0c6d3e992d2f34818611efedcf91fc1e224efe6c2","observation_id":"6379fb25-0387-4b33-b42b-fc7a63bb6b57","resolution":{"observed_at":"2026-08-12T11:11:43.687845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.09148","last_updated":"2023-05-02T17:06:51Z","snapshot_observed_at":"2026-08-19T05:54:16.174622Z","submitted_at":"2023-04-18T17:38:54Z","title":"SAM Fails to Segment Anything? -- SAM-Adapter: Adapting SAM in Underperformed Scenes: Camouflage, Shadow, Medical Image Segmentation, and More","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.09148","snapshot_observed_at":"2026-08-12T11:11:43.692410Z","title":"Sam fails to segment anything?–sam-adapter: Adapting sam in underperformed scenes: Camouflage, shadow, and more","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.692410Z"},"links":{"cited_paper":"/paper/2304.09148","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:69bf1c485a1e60990fe0bf58c8494204c05a7567727ff724f470a9806cf81de7","observation_id":"b7a0740e-7a2a-4eb7-86a5-7d84b5581169","resolution":{"observed_at":"2026-08-12T11:11:43.692410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04297","last_updated":"2020-03-09T17:56:49Z","snapshot_observed_at":"2026-07-06T09:03:25.467987Z","submitted_at":"2020-03-09T17:56:49Z","title":"Improved Baselines with Momentum Contrastive Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04297","snapshot_observed_at":"2026-08-12T11:11:43.697394Z","title":"Improved baselines with momentum contrastive learning","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.697394Z"},"links":{"cited_paper":"/paper/2003.04297","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:bf624df0c18696a6dd3afe71d1e20c11fac0f4118a73f33b6a5832f1aa93f06a","observation_id":"00252cb6-46ce-479e-a8e6-b9e506700168","resolution":{"observed_at":"2026-08-12T11:11:43.697394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.702405Z","title":"Imagenet: A large-scale hierarchical im- age database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.702405Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:0cdbb6fab20a5500eb5b41d4280771ea1388edfd427612d2cda04fea685e61fa","observation_id":"ff1ea2aa-2ee9-4dce-917f-a334af241bcc","resolution":{"observed_at":"2026-08-12T11:11:43.702405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.706955Z","title":"Lift: Language- interfaced fine-tuning for non-language machine learning tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.706955Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:550c2acf673bd2da43b3c867c11bbf21b6fbe4494575f0dbfb24df950e084cae","observation_id":"928c5971-fa53-4acb-8471-ba12da6e487c","resolution":{"observed_at":"2026-08-12T11:11:43.706955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.711124Z","title":"Hyperspectral image super-resolution via non-negative structured sparse repres- entation","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.711124Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:f7755da6ab022fb29080715b494b46f1264679967da5d926533610f439d68f5b","observation_id":"875e70da-0c68-4c23-8bc3-e5aa735fb8e3","resolution":{"observed_at":"2026-08-12T11:11:43.711124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.715480Z","title":"An image is worth 16x16 words: Trans- formers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.715480Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:ec02d8c03a720210ebafc30d3cf21ae8c03b215c4e3b1b967a9965d3b126a057","observation_id":"bd480787-7f72-4abc-bfd0-cffbc8d25f69","resolution":{"observed_at":"2026-08-12T11:11:43.715480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.719637Z","title":"Multiscale vision transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.719637Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:334f4dc2b0bef2e08e0daa465587ed5fcccaded843e9a031a96bd3e4267cc6a6","observation_id":"f0b7825d-2414-4013-85c3-3652625f2051","resolution":{"observed_at":"2026-08-12T11:11:43.719637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.724038Z","title":"Event-based vision: A survey","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.724038Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:4e15456e6dd0e4a97a9998b3967313d93ca86582425cd697e45870ac2af8f55e","observation_id":"8c13dfe7-70b0-4a93-bfc1-3c129c603fde","resolution":{"observed_at":"2026-08-12T11:11:43.724038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.728339Z","title":"Low-latency auto- motive vision with event cameras","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.728339Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:01610ecc437f8963ea7a834e073fdb4a6902f5d7432c27f1fdf44674d12360e6","observation_id":"3ebd8af7-2dc8-4963-9c6c-e7015a5dd3a2","resolution":{"observed_at":"2026-08-12T11:11:43.728339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.733122Z","title":"Imagebind: One embedding space to bind them all","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.733122Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:dc7bf51db25aa8a4a74f3746db533b6792f3ab75869d3bad650bcb2387a67759","observation_id":"aa4eda63-cb61-43dd-ab1a-2954d1001518","resolution":{"observed_at":"2026-08-12T11:11:43.733122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.01778","last_updated":"2021-07-08T20:16:28Z","snapshot_observed_at":"2026-08-17T23:50:11.173365Z","submitted_at":"2021-04-05T05:26:29Z","title":"AST: Audio Spectrogram Transformer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.01778","snapshot_observed_at":"2026-08-12T11:11:43.737620Z","title":"Ast: Audio spectrogram transformer.arXiv preprint arXiv:2104.01778,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.737620Z"},"links":{"cited_paper":"/paper/2104.01778","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:6c51607aa88deb5b4df622b4a5a45f10c7366c40bfdbf704814cc45631af9333","observation_id":"0b1aa502-3d72-4f20-8bf4-22a2a8d23daa","resolution":{"observed_at":"2026-08-12T11:11:43.737620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.742245Z","title":"Bootstrap your own latent-a new approach to self-supervised learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.742245Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:db550ac2d6720d6ad18c14d7fd0416130083b8fcc47d48e51318ba7669b76e12","observation_id":"f62be8ee-b251-4707-9c55-748b623a5dff","resolution":{"observed_at":"2026-08-12T11:11:43.742245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.746222Z","title":"Pct: Point cloud transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.746222Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:1ed4953570ff1e98b5e8ebc6daf223f7ac8a2b56eb526b6fc4c0033f26971099","observation_id":"513cca78-48d8-412c-8db2-0ebe4a256dc9","resolution":{"observed_at":"2026-08-12T11:11:43.746222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.750517Z","title":"Learning rich features from rgb-d im- ages for object detection and segmentation","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.750517Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:e1a44dfeeaf570f6f5b192a4c8fbb33b9961bf91c682e391080e65482b5d8535","observation_id":"fb5e766a-4321-4d5e-815a-30dfe248b5c5","resolution":{"observed_at":"2026-08-12T11:11:43.750517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04366","last_updated":"2022-02-02T16:39:23Z","snapshot_observed_at":"2026-08-18T09:21:01.141614Z","submitted_at":"2021-10-08T20:22:26Z","title":"Towards a Unified View of Parameter-Efficient Transfer Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04366","snapshot_observed_at":"2026-08-12T11:11:43.754991Z","title":"Towards a unified view of parameter-efficient transfer learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.754991Z"},"links":{"cited_paper":"/paper/2110.04366","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:381ea1da45b95e175151e36114404ab6f7981091282edc822075ef499748587d","observation_id":"de1db3b7-f77d-4cac-97d7-79420518623a","resolution":{"observed_at":"2026-08-12T11:11:43.754991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.760869Z","title":"Momentum contrast for unsupervised visual rep- resentation learning","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.760869Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:8650446c1d26926f5546465e9f9ae2869848b29cc19e2dcdae4f21f8892689b3","observation_id":"4cdcacbb-0e1e-4983-8dce-cf8e4c53a219","resolution":{"observed_at":"2026-08-12T11:11:43.760869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.765839Z","title":"Masked autoencoders are scal- able vision learners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.765839Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:b09e0b3a26794392732a8ab5c01adab30d04c1f3cd250703b2f86dc7859ace90","observation_id":"7d0f6cc1-663c-40a0-a31b-ff87444dec00","resolution":{"observed_at":"2026-08-12T11:11:43.765839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.771836Z","title":"Parameter-efficient transfer learning for nlp","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.771836Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:a9e6d9eebfaa4c4c3aeab33c60144bf834f4c7d00cf03a7f627183dc7561f92b","observation_id":"60bfe44c-850c-4425-bf79-d62a81ec2c09","resolution":{"observed_at":"2026-08-12T11:11:43.771836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.776897Z","title":"Lora: Low- rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.776897Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:5098a7a382481100a59cae80e24e4361c5318e3a9b78665164c685de88560c77","observation_id":"d07be425-4a83-4343-8586-231f47192a01","resolution":{"observed_at":"2026-08-12T11:11:43.776897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.782398Z","title":"Polarization structured light 3d depth image sensor for scenes with reflective sur- faces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.782398Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:ff04ac3bed5f1bce8d9cd712abf20e0e81653627d8167907e54853e417724c67","observation_id":"e12e30d7-9be2-46c1-ae23-a30a9a0af1db","resolution":{"observed_at":"2026-08-12T11:11:43.782398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.787167Z","title":"Glass segmentation with rgb-thermal image pairs","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.787167Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:7881bc74ca0e05df663eb48bcabfcce4b56d7d6f8ff7c968a2d501bdd3614fe2","observation_id":"546fd074-1fd8-486d-9478-130b67c5b4fb","resolution":{"observed_at":"2026-08-12T11:11:43.787167Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.792232Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.792232Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:b5a0c5b2dcda66970fd90b5c0b48c6a6eaff656568655245913a5ace917b6890","observation_id":"f3635d6b-34bc-42c4-873c-bb9f7eded2a6","resolution":{"observed_at":"2026-08-12T11:11:43.792232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.797001Z","title":"Perceiver io: A general architecture for structured inputs & outputs","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.797001Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:51d53d696eae6c276b6795002bc5c4d6164c7a14fd9edb2f46feaaf69df6d1e4","observation_id":"14d56bac-e093-44ad-ad57-cc3f9a47ff27","resolution":{"observed_at":"2026-08-12T11:11:43.797001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.06022","last_updated":"2023-09-30T13:01:52Z","snapshot_observed_at":"2026-08-19T05:54:18.968372Z","submitted_at":"2023-04-12T17:58:03Z","title":"SAM Struggles in Concealed Scenes -- Empirical Study on Segment Anything","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.06022","snapshot_observed_at":"2026-08-12T11:11:43.802397Z","title":"Sam struggles in concealed scenes–empirical study on” segment anything”","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.802397Z"},"links":{"cited_paper":"/paper/2304.06022","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:741668ef5fda49f6f3f190f57654bf22569d2d1d1bd13e5027574834112ded12","observation_id":"6fb28d69-b0d4-4eee-a5f0-02f02e3bbc74","resolution":{"observed_at":"2026-08-12T11:11:43.802397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.807787Z","title":"Visual prompt tuning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.807787Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:9d0b384ce180da35cbe74fd17ac1803cbcdc6f74dfc7bbbf431e0fc7264c3079","observation_id":"7c8b73c4-a382-4b95-902b-1030a05a2f36","resolution":{"observed_at":"2026-08-12T11:11:43.807787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.813021Z","title":"A multi-modal pre-training transformer for univer- sal transfer learning in metal–organic frameworks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.813021Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:45c0ee376a03bff11418f1b99b2ea7ccd2a269063ededccdaa4a01dd4192df08","observation_id":"0795cdab-86d4-4dee-be71-6065a7f48257","resolution":{"observed_at":"2026-08-12T11:11:43.813021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.817504Z","title":"Bert: Pre-training of deep bidirectional trans- formers for language understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.817504Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:a6072da324fde9c8ff90d11f133a317d5dbcfd5164db7095273e8f3c073c6253","observation_id":"b78f6f17-55fd-49c4-a3f6-9636edc4e4f9","resolution":{"observed_at":"2026-08-12T11:11:43.817504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.495259Z","title":"Segment anything","venue":null,"work_id":"ce19ba6d-f5a4-4a67-9944-174d80ce96e9","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.821737Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:26f502b1191b8abd3fec88d04d37f2bb825751045ed3980ed01e89c905587f12","observation_id":"0c81c926-f572-471a-b139-222808e45c42","resolution":{"observed_at":"2026-08-12T11:11:45.500119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.479308Z","title":"Decou- plenet: Decoupled network for domain adaptive semantic segmentation","venue":null,"work_id":"68396152-e2dd-441a-83a9-0bfa8c75bfd6","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.825736Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:465a7546254fd1932fa9fc2627731c2224f5de56231f317455a6e083c2779cc0","observation_id":"941c96fa-a584-48fa-a9af-edf8e2deebe1","resolution":{"observed_at":"2026-08-12T11:11:45.484572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.460858Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":"1d4b4240-5550-421b-8e5f-370e2526616e","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.830207Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:92a262961a1f4bc388101724197993d24354d28fee27ece1bd98350db2784f67","observation_id":"9dda10d9-39af-4c38-84c0-3d2e4233db57","resolution":{"observed_at":"2026-08-12T11:11:45.467397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.444213Z","title":"Polarized reflection re- moval with perfect alignment in the wild","venue":null,"work_id":"6a9a000b-bd8e-42e6-b12d-6b89f5167f30","year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.834331Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:163102492ca6568348a7026e8a0feda06f71180c6d37ee6efb86cf46f9cf3959","observation_id":"f287ed60-7535-4bfa-af01-3a745882cdfd","resolution":{"observed_at":"2026-08-12T11:11:45.449280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.428172Z","title":"Shape from polarization for com- plex scenes in the wild","venue":null,"work_id":"9a59e8ee-20da-4a4d-9d9d-8f551484d40e","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.838920Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:02ec458a070ef5e2b05122499a1f3b5043583bb6569c7c2c30f9201747dc4a45","observation_id":"4d708cc9-d7d1-4b37-9a77-615e376975d4","resolution":{"observed_at":"2026-08-12T11:11:45.433682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T11:11:43.843444Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.843444Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:e90876b5af772dc407887e6b9cd07204082d4ce7398d7769910d80465809ccd1","observation_id":"25cd7fbd-0fd1-4ae4-8808-49a6b17f93bb","resolution":{"observed_at":"2026-08-12T11:11:43.843444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.412128Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":"bbdce7b9-9117-466c-a6d4-eb9132cda9d6","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.849346Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:4ba186030acb405cc1f72634a831a7bf9fe13ea7d1308e931196c51b238491f0","observation_id":"4ad4e292-c23c-45ae-9f99-13789b6532fe","resolution":{"observed_at":"2026-08-12T11:11:45.417416Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-20T20:46:48.871047Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-12T11:11:43.854002Z","title":"Prefix-tuning: Optim- izing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.854002Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:4980fbd4f4bf1552b7070be3a9ed498c1e835fa67e797dd23e463141a5603ae2","observation_id":"e55e324e-3605-4a85-98e4-ff80721cc9f3","resolution":{"observed_at":"2026-08-12T11:11:43.854002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.393570Z","title":"Heterogen- eous domain adaptation: An unsupervised approach","venue":null,"work_id":"fb6fe357-e488-40b7-abec-629611f76235","year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.859130Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:abd4cbe5edb7d4aa1f5e4425060c278c90f8ef2e5e6098010260ec02ba424868","observation_id":"10eec4c9-99c6-40dd-8bb8-954998a9e43c","resolution":{"observed_at":"2026-08-12T11:11:45.400239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.377009Z","title":"Visual instruction tuning","venue":null,"work_id":"cdbd488b-6161-4e7f-aa79-0af250f79192","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.863750Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:13862687875d07d9f8267b3249f2e7e68213f0676326785f3facb907627860db","observation_id":"644e45ed-e840-40c7-a6ed-1f5780fa9686","resolution":{"observed_at":"2026-08-12T11:11:45.382106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.868821Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.868821Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:ed2125ff7739dda0c11d2370de1526c03de5a035e123842b929b3bc0120de568","observation_id":"4fa89c58-e36e-4b8c-bf18-fe7124be4f49","resolution":{"observed_at":"2026-08-12T11:11:43.868821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.349590Z","title":"Frozen pretrained transformers as universal compu- tation engines","venue":null,"work_id":"2e0bf0d4-5128-4299-9dcb-96f70fc9d7d7","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.873580Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:18b44d94c47f665183546821219d900e9dab263fcba34940b8ac21a6712af7c0","observation_id":"7dbbdce5-65bc-4bf2-bfce-02da01f68a64","resolution":{"observed_at":"2026-08-12T11:11:45.354759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.331951Z","title":"Transferring knowledge fragments for learning dis- tance metric from a heterogeneous domain","venue":null,"work_id":"0ce6fe05-7e47-42a2-a505-a8adfa5982a5","year":2018},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.878532Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:76bde36c422769daa85fbcd495bd0f21596616a461e776e556edc51969253f1d","observation_id":"d34170dc-33cc-40ab-aaa5-3b0eeb9349e6","resolution":{"observed_at":"2026-08-12T11:11:45.337493Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12306","last_updated":"2024-04-01T16:18:16Z","snapshot_observed_at":"2026-08-17T23:17:37.298054Z","submitted_at":"2023-04-24T17:56:12Z","title":"Segment Anything in Medical Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12306","snapshot_observed_at":"2026-08-12T11:11:43.883286Z","title":"Segment anything in medical im- ages","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.883286Z"},"links":{"cited_paper":"/paper/2304.12306","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:a9ad7837183fae8c624153884dcfb355aab5e208bd126f0fddeb6fca468d8c36","observation_id":"9c2216cd-a132-41d5-93c7-02ccf00da84d","resolution":{"observed_at":"2026-08-12T11:11:43.883286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:43.889200Z","title":"Segment anything in medical images","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.889200Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:f0c8199ee60716616fa0c32559a5e73ddb5313d33581c15c844e49e40acddc7a","observation_id":"5666c991-91d2-4f8e-8c3b-c8bdbbefdc59","resolution":{"observed_at":"2026-08-12T11:11:43.889200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.304498Z","title":"Mul- timodal tactile sensing fused with vision for dexterous ro- botic housekeeping","venue":null,"work_id":"d8fce84a-ae18-43b5-b167-49b200c85837","year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.894148Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:1b00e23dda01f5f0c02d3e2633481f9d52bcbd39e6256f4e3e211f183c465372","observation_id":"46d10936-2142-4fbe-8605-1b83465b5f47","resolution":{"observed_at":"2026-08-12T11:11:45.309705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.286054Z","title":"Glass segmentation using intensity and spectral polarization cues","venue":null,"work_id":"1b550e70-afb5-41af-885d-9415c5bfd515","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.899093Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:97ad2cc163974426845af038d7d53583225058b65372c213428b72e4518a642d","observation_id":"b55084c3-3729-411f-8ee3-9ba50ca06ed3","resolution":{"observed_at":"2026-08-12T11:11:45.291183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.270523Z","title":"Scaling deep learning for materials discovery","venue":null,"work_id":"3b765d68-072d-4d32-9dfb-97f6d60d1775","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.904104Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:710f835c215a1c5a92347d310065d6ce263b45a6e993adfdec6c323812b80c8b","observation_id":"53e53330-abf0-4386-b828-6d8a80fccbdb","resolution":{"observed_at":"2026-08-12T11:11:45.275679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.255124Z","title":"4m: Massively multimodal masked modeling","venue":null,"work_id":"c82130e1-8547-4e75-8c9d-110ef6f48b9e","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.909161Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:075a5580b21ef6ddee76290575073115eb04a5b1a7c562c5b34b24e41b06cb34","observation_id":"f8043947-5ea6-4ad9-92ff-a2cb7c8b2809","resolution":{"observed_at":"2026-08-12T11:11:45.260078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.238815Z","title":"Indoor segmentation and support inference from rgbd images","venue":null,"work_id":"f81b9563-e13e-41c1-817b-28a6b024b3ff","year":2012},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.914078Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:312b0b3089c121ab7b84d6b6ddf9878c28138aa542d55f5e1478ab999e1ac3fc","observation_id":"accd9ac8-6cc7-4dd2-b6b9-81579f69a7e6","resolution":{"observed_at":"2026-08-12T11:11:45.244205Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.221809Z","title":"Training lan- guage models to follow instructions with human feedback","venue":null,"work_id":"ce0efaab-ae1e-4bf6-b74c-dbbcafd7cf1a","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.919217Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:5eeaa33b4722bc8276a7e58362d8e73277fb349463f9773b8569f05127c8f4e5","observation_id":"c95163c2-192d-4e88-99c3-61566478a627","resolution":{"observed_at":"2026-08-12T11:11:45.227679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.203513Z","title":"Foundation model for cancer imaging biomark- ers","venue":null,"work_id":"107987b0-80ce-48b6-9c9a-60cec10945ec","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.923751Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:fa0d04c16e097f3be458424d3beeae7def53a6d35674c31da9d24c396b27f8cf","observation_id":"73d75103-60e8-4d46-beb7-ef5e3cfbf673","resolution":{"observed_at":"2026-08-12T11:11:45.209297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.187757Z","title":"Unsupervised intra-domain adaptation for semantic segmentation through self-supervision","venue":null,"work_id":"1e32f59a-7986-4702-82e9-41a5c99dc589","year":2020},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.928030Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:9b716e6a574e06480d993adfe96293fc3f8c4f24a241355cd486dc72d2bac789","observation_id":"068ef4fc-4dd2-4bf7-b946-93690bb7d9b9","resolution":{"observed_at":"2026-08-12T11:11:45.192584Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.171556Z","title":"Transfer learning for metal–organic frameworks","venue":null,"work_id":"a0cb457b-a041-42aa-9e02-5973685cde01","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.933224Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:6279d8b96196fd44385e999daf5dd78c963c4a24accaf2b3d876e7d82051cb05","observation_id":"f6f15a3b-7835-4e21-91e4-9f9a006069e7","resolution":{"observed_at":"2026-08-12T11:11:45.177241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.155319Z","title":"A survey on transfer learning","venue":null,"work_id":"c8ce6a6b-1f34-4e61-8bce-1ff7e3f7e158","year":2009},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.939363Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:32fc72c368d4dd4c1b93d30d38b7004ddfc71ea7e14e0c8245b1bdf178f62f7d","observation_id":"cff9635a-ef76-4153-b72a-072bfd67f0d2","resolution":{"observed_at":"2026-08-12T11:11:45.160473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.140020Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"d32c8492-2cc9-49d9-a313-0951b18df5bf","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.944035Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:bb2295cbecaf9a2164fb9b3102c027f2a71ab3aaae952d1047707e60cf134b08","observation_id":"86bad8f6-3810-4f19-acc8-0dc040de502f","resolution":{"observed_at":"2026-08-12T11:11:45.145065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.122641Z","title":"Transfer learning with kernel methods","venue":null,"work_id":"04c276c6-da2f-44c9-a142-98b54a3239f3","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.951561Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:ec4baa312f2a0be0b500e1da29b77580df78c0cbd5ef5d44c46a6180d9588d84","observation_id":"06b5f924-987f-4566-a010-235b73cf2199","resolution":{"observed_at":"2026-08-12T11:11:45.127675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.106137Z","title":"High-resolution image synthesis with latent diffusion models, 2021","venue":null,"work_id":"8184fe6b-743e-4b2b-9c45-6782e24ca9ef","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.956913Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:52671e9c7efa154eba8bddaaf26d2a0573f3113149a7a69eb976c94afc6637c9","observation_id":"97891fc1-bfeb-41ba-ad2b-052fcd7258f3","resolution":{"observed_at":"2026-08-12T11:11:45.111483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.088424Z","title":"Cross-modal fine-tuning: Align then refine","venue":null,"work_id":"4a3cc281-1eef-410b-a30b-870f4f10508d","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.961413Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:7699c9e5b81466d35d05384d3148ed49f94365f7b2b767c895e7a317e1118875","observation_id":"c1c4d721-e0e0-44bb-a6bb-5d9b63d3841c","resolution":{"observed_at":"2026-08-12T11:11:45.094507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.069526Z","title":"Depth estimation from camera im- age and mmwave radar point cloud","venue":null,"work_id":"3c9316ba-ee9a-45e9-86ef-b075bc4c1e7b","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.965948Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:83afe0992068a0a89fb6a4cb718e8a6744294a5049fbb8afa1e4a3716c96e1f4","observation_id":"83d2ef80-e836-4ac3-953f-b6132494a1c8","resolution":{"observed_at":"2026-08-12T11:11:45.075398Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.046791Z","title":"Rna secondary structure prediction using an en- semble of two-dimensional deep neural networks and trans- fer learning","venue":null,"work_id":"1bc1b66e-ea2f-488c-be5a-b75b7dacaedf","year":2019},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.970400Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:408462d884b758ee40f5b86b08f872767a7f66b0cde2a61ca7b4640a7b3fbafc","observation_id":"7e87b243-10b3-4917-860e-fd4e41809e8f","resolution":{"observed_at":"2026-08-12T11:11:45.052479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.024808Z","title":"Rtfnet: Rgb- thermal fusion network for semantic segmentation of urban scenes","venue":null,"work_id":"7f64c9d1-ad00-45f4-b411-45c2371d72f0","year":2019},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.975013Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:162511ad07403b529ee86cb2646e68475bde3d7d38825617c04f04b65c18e8b8","observation_id":"4c2e424d-cf75-40b9-bc24-64034af6a5ab","resolution":{"observed_at":"2026-08-12T11:11:45.030411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:45.007005Z","title":"Seeing far in the dark with patterned flash","venue":null,"work_id":"a2bfb0b5-aa2d-4c58-a0ad-4fbc63d188ed","year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.979622Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:bbf3605d0f376e26fb28262fb05b12a488d33f45ca7dbab93edaa0ef100bffa4","observation_id":"b214f3e3-45fc-48a0-85c1-a2de8414bcdb","resolution":{"observed_at":"2026-08-12T11:11:45.012532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.990247Z","title":"Dabs: A domain-agnostic benchmark for self-supervised learning.Advances in neural information processing systems, 2021","venue":null,"work_id":"a075b7ab-27c7-429a-b8cd-33cdc70fe199","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.984622Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:f5792c916d809a89bc8fe36a6bf0a10cd676b6050cc6b3c93bb1ba338c893fad","observation_id":"4777f815-8e25-426e-bc29-61b3e24ab013","resolution":{"observed_at":"2026-08-12T11:11:44.995428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04709","last_updated":"2023-04-11T03:53:13Z","snapshot_observed_at":"2026-08-16T15:41:32.048576Z","submitted_at":"2023-04-10T17:05:58Z","title":"Can SAM Segment Anything? When SAM Meets Camouflaged Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04709","snapshot_observed_at":"2026-08-12T11:11:43.990171Z","title":"Can sam segment anything? when sam meets camouflaged object detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.990171Z"},"links":{"cited_paper":"/paper/2304.04709","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:50edf9669d3f181d780937e987ce3a1659dc48b235b5cde1034c2c16e574aef8","observation_id":"a79ed7bd-6687-42fe-aad5-1f16f47012a6","resolution":{"observed_at":"2026-08-12T11:11:43.990171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-12T11:54:14.007649Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-12T11:11:43.995206Z","title":"Chameleon: Mixed-modal early-fusion foundation models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:43.995206Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:92fc666cdf922fed4462eeab1e66fd0d0c9012fb966fb1558f2d63692fa096dc","observation_id":"565f0341-4757-42f8-8218-9e840c729478","resolution":{"observed_at":"2026-08-12T11:11:43.995206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T11:11:44.000620Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.000620Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:a48287f85a004a7e6ce07e02e1074adbc3f31a367c5fed32f4b69dd686debda1","observation_id":"3c729aae-4a88-4e9d-8863-f4d6003a21a7","resolution":{"observed_at":"2026-08-12T11:11:44.000620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.972569Z","title":"Neural nano-optics for high-quality thin lens ima- ging","venue":null,"work_id":"fbae4b8f-2729-495f-9add-9df0ace99c9a","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.005657Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:b0c016bc9103c3b29a279c49848dd43005f88ea3468e22106dc827e3852fdbf9","observation_id":"cad8bd9b-6993-4ec3-830f-0ad5ba3f59a9","resolution":{"observed_at":"2026-08-12T11:11:44.977736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.010204Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.010204Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:b2c31a3f2bea0cd5d5a34fab569f971fea157d8a5e63d1c88edc3079876aecd6","observation_id":"ca7fac17-64c8-4745-9ace-07f5978b9f2d","resolution":{"observed_at":"2026-08-12T11:11:44.010204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.00335","last_updated":"2025-05-11T23:57:58Z","snapshot_observed_at":"2026-08-16T18:27:39.380785Z","submitted_at":"2021-05-01T19:38:30Z","title":"Audio Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.00335","snapshot_observed_at":"2026-08-12T11:11:44.014616Z","title":"Audio transformers: Transformer architectures for large scale audio understand- ing","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.014616Z"},"links":{"cited_paper":"/paper/2105.00335","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:777b3b1ae0ba2ad57bed20c6e2e9569faf937276f47bc44c3bc6c896d8458d62","observation_id":"3f7daf65-04ca-4676-b784-6acec83ac5b4","resolution":{"observed_at":"2026-08-12T11:11:44.014616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.02120","last_updated":"2023-01-05T15:55:18Z","snapshot_observed_at":"2026-08-16T16:04:13.287518Z","submitted_at":"2023-01-05T15:55:18Z","title":"Reprogramming Pretrained Language Models for Protein Sequence Representation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.02120","snapshot_observed_at":"2026-08-12T11:11:44.019553Z","title":"Reprogramming pretrained language models for protein sequence represent- ation learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.019553Z"},"links":{"cited_paper":"/paper/2301.02120","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:c9ce261b3cbf0610503d1837fdf050df4cbc9213a77ee5e118a4d234e66f2d99","observation_id":"d822514d-043d-4ede-969f-f5a5ffdfbc44","resolution":{"observed_at":"2026-08-12T11:11:44.019553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.945599Z","title":"Advent: Adversarial entropy min- imization for domain adaptation in semantic segmentation","venue":null,"work_id":"38206ea9-c940-4dcb-86cb-fb10d3778b43","year":2019},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.024427Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:2b8dfb5f3256eb717689312baaa1839dc7c3d96dcdc3750db244b0097d71af09","observation_id":"6823c460-b6af-4460-b198-39ec4edacad4","resolution":{"observed_at":"2026-08-12T11:11:44.950380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.929957Z","title":"Predicting fault slip via transfer learning","venue":null,"work_id":"1500e427-aa73-447a-b951-63ebe158a8eb","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.029156Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:a8c62316f811a833c2b68f30cec05b81d870a6e6b00c93ba4b0cd0c656b441fa","observation_id":"4f00e47c-49c2-4598-9746-21cd4bd3ebf2","resolution":{"observed_at":"2026-08-12T11:11:44.934923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.913379Z","title":"Uncertainty-aware clustering for unsupervised domain adaptive object re- identification","venue":null,"work_id":"fb502b11-5d02-432a-bec4-06918b9c220a","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.033798Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:7295d260e5c373f74cf23265b8f3f13ead44740b7ff26b5c776fda6000a5a613","observation_id":"ad138850-2302-4609-b9e5-ccc696837950","resolution":{"observed_at":"2026-08-12T11:11:44.918456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.896882Z","title":"Sub-surface thermal measurement in additive man- ufacturing via machine learning-enabled high-resolution fiber optic sensing","venue":null,"work_id":"a52ddab0-1579-40f1-b1f9-2ffa82e45bf5","year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.038542Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:d8708211f309573ddee416005e6550f7a8962533ae29202e620977b07da4ea2c","observation_id":"61fa1df1-6362-43c2-864f-0cec33c1367a","resolution":{"observed_at":"2026-08-12T11:11:44.902779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.880580Z","title":"Internimage: Exploring large-scale vision foundation models with deformable convolutions","venue":null,"work_id":"4caa2ae5-5100-4e22-8e88-88de9825aa70","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.043144Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:f03404152214ce53c853015fc92e6866dfdc75abab89c5d03ccaa3a906ce9ab2","observation_id":"4ecabf92-0f36-4334-a5b7-1c2a354b0b61","resolution":{"observed_at":"2026-08-12T11:11:44.885725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.864786Z","title":"Internimage: Exploring large-scale vision foundation models with deformable convolutions","venue":null,"work_id":"21dbcd2f-eea7-47dd-a5c9-03420b47ec97","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.047276Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:c9ce3e173a7fbe230819b79fa8c8b67fe311ddb6773615de5e8357aa7a3ce38d","observation_id":"f127eddc-b36e-4979-895c-20aee68786c3","resolution":{"observed_at":"2026-08-12T11:11:44.869848Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.848277Z","title":"Not all images are worth 16x16 words: Dynamic transformers for efficient image recognition","venue":null,"work_id":"79d9a9ac-78fb-4564-a329-0f9d60babab9","year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.051394Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:c6340df019c634ef41ce5f27001115ee1c1cd71e5b432f46f64a41d0af89795c","observation_id":"23c1628a-64b7-4d88-9e73-7b8b630f8893","resolution":{"observed_at":"2026-08-12T11:11:44.853975Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.832324Z","title":"Randomized quantization: A generic aug- mentation for data agnostic self-supervised learning","venue":null,"work_id":"1d7007fa-cfe4-43eb-b5ba-604db20c1246","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.055767Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:4545af97db3bc27e2a3aeb896643e5dc47de47bb8ea7bc6ccd770c17cc38833a","observation_id":"10f59e66-5ad6-40ac-8963-0d29f393bb8f","resolution":{"observed_at":"2026-08-12T11:11:44.837501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12620","last_updated":"2023-12-29T03:40:59Z","snapshot_observed_at":"2026-08-19T01:36:43.080792Z","submitted_at":"2023-04-25T07:34:22Z","title":"Medical SAM Adapter: Adapting Segment Anything Model for Medical Image Segmentation","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12620","snapshot_observed_at":"2026-08-12T11:11:44.060072Z","title":"Medical sam adapter: Adapting segment anything model for med- ical image segmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.060072Z"},"links":{"cited_paper":"/paper/2304.12620","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:59fbdd0288a12192b11a234f102e7fbce50139a6c2766b6d8c0351c3debfc9d9","observation_id":"066ba7b0-eb8c-4dc6-8b9d-8c6f27240a2a","resolution":{"observed_at":"2026-08-12T11:11:44.060072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.816507Z","title":"Point transformer v2: Grouped vector attention and partition-based pooling","venue":null,"work_id":"ca4d657c-42c3-419c-9e28-85e31ae183b2","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.064535Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:41ff7c1a39a330eebdb51bc8c4eea3dc9b15681059ffdb7385fe3fc1fc80491f","observation_id":"7610d777-8719-496f-ac35-6cbbd246f965","resolution":{"observed_at":"2026-08-12T11:11:44.821699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.799040Z","title":"Polarization- driven semantic segmentation via efficient attention- bridged fusion","venue":null,"work_id":"a9093076-b66f-477c-b73c-a8a08fc63c5a","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.068979Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:e8c169eccafe0dbfd2bd20b8a8350bd4d87c02bcd6fde7fd16339e29fcbc4998","observation_id":"effa0f06-bd53-440b-ac5a-7ad065461ac3","resolution":{"observed_at":"2026-08-12T11:11:44.804075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.782658Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"8dc392fb-48be-44ee-b454-9181c55951c5","year":2022},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.073227Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:50e41e8a3b277c7b808dc961dcdd0f54a7375ea714fe04c79daab7f7deeef800","observation_id":"afeee50c-7441-4767-bb11-0700f8bd5ea3","resolution":{"observed_at":"2026-08-12T11:11:44.788279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.765795Z","title":"Video-rate hyperspectral camera based on a cmos-compatible random array of fabry–p ´erot filters","venue":null,"work_id":"8f16bd03-614b-4a77-bb1c-fe2500f03740","year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.077351Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:a9e7eda4dfb8590852e592039b2acb07c28f353519c4452882d64991aa8838e7","observation_id":"81c6824e-a3df-404c-9586-bcd5347f2fc7","resolution":{"observed_at":"2026-08-12T11:11:44.771216Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.748519Z","title":"A vision chip with complement- ary pathways for open-world sensing","venue":null,"work_id":"abdaedfa-0898-4cbf-9052-fd6176c01db6","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.082038Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:364e819da725d0f1da7c5d19c5875fe530e99dc28a2eb8c985f954c5565f482a","observation_id":"5dff3ee4-ed84-4a68-a5d6-c8bd09e63425","resolution":{"observed_at":"2026-08-12T11:11:44.753707Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.732279Z","title":"Superanimal pretrained pose estimation models for behavioral analysis","venue":null,"work_id":"02388da5-59f1-4714-a07c-bda1932864de","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.086340Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:fd519c8769803bc2498d953a93de190980df90695e1a3af294b9c33cbf328578","observation_id":"446d231f-7ffc-44c6-a56a-d94ac5de401b","resolution":{"observed_at":"2026-08-12T11:11:44.737994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.715642Z","title":"Taskonomy: Disentangling task transfer learning","venue":null,"work_id":"589b7eca-d099-457b-b04e-4760519a3d5d","year":2018},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.090316Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:47a02444049cd523bc5a07d916fa8a654c597fc9849ed7b9fdd310137b13e4a1","observation_id":"6fed5e57-f360-4e72-8d75-6b9b40c2d8db","resolution":{"observed_at":"2026-08-12T11:11:44.720905Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.699053Z","title":"Cmx: Cross-modal fusion for rgb-x semantic segmentation with transformers","venue":null,"work_id":"2838b068-64f1-4403-804b-f5528a9a99de","year":null},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.095133Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:cb7099a300f29d8e3c8f2baee533c949d977e8c02088daf480de9d9b18e064cc","observation_id":"2350e08c-a058-4bf7-91aa-4b03f645b773","resolution":{"observed_at":"2026-08-12T11:11:44.704284Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.681999Z","title":"A generalist vision–language foundation model for diverse biomedical tasks","venue":null,"work_id":"a8860135-164d-449b-a35e-f978abd5e704","year":2024},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.100477Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:31c5501966830a0bfd1295b0d58f4af27ae21bdd7db6b2876d21c30f73d7a732","observation_id":"0b4162d3-d1e2-4c53-8912-a03dd8574797","resolution":{"observed_at":"2026-08-12T11:11:44.688419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.105360Z","title":"Adding conditional control to text-to-image diffusion models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.105360Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:70238486f8970cbac349d645fa6564b9a0b29c2b41a738713fd91491176d0d6c","observation_id":"94ea45ef-deb7-475d-a6db-1711ba12dc73","resolution":{"observed_at":"2026-08-12T11:11:44.105360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10802","last_updated":"2023-07-20T12:10:29Z","snapshot_observed_at":"2026-08-18T15:25:55.049244Z","submitted_at":"2023-07-20T12:10:29Z","title":"Meta-Transformer: A Unified Framework for Multimodal Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10802","snapshot_observed_at":"2026-08-12T11:11:44.110303Z","title":"Meta- transformer: A unified framework for multimodal learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.110303Z"},"links":{"cited_paper":"/paper/2307.10802","citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:8f5eaa6221ecfe0b209db6097b74efc0589e3b0ca0cf041a86455c6bc1c1101a","observation_id":"46ade355-5cce-4fbb-bda0-a10bccdad22b","resolution":{"observed_at":"2026-08-12T11:11:44.110303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T11:11:44.655428Z","title":"Point transformer","venue":null,"work_id":"27e12b4f-c646-49f1-a09c-6857663d84b4","year":2021},"citing_paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T11:11:44.115214Z"},"links":{"citing_paper":"/paper/2411.18669"},"observation_digest":"sha256:2839841c18dc1fd530a2b57046cf2b8bc3503a1669fedf54df52735b89be712f","observation_id":"2f3e07a2-5347-4f40-809f-d94f569c22d7","resolution":{"observed_at":"2026-08-12T11:11:44.660954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.18669","last_updated":"2024-11-27T16:35:58Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T09:43:38.189970Z","submitted_at":"2024-11-27T16:35:58Z","title":"SimCMF: A Simple Cross-modal Fine-tuning Strategy from Vision Foundation Models to Any Imaging Modality"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":52,"verified_exact":0,"verified_fuzzy":48},"total_outbound_references":111},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 100 of 111 outbound references and 0 inbound Pith citation observations for arXiv:2411.18669."}