{"as_of":"2026-08-09T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4a600b721291ca2e01d6990f1ba0df310907b7452f3926e3df3b1a0cabc58f9f","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:18:29.140260Z","state":"measured"},{"denominator":83,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":83,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.16318/citation-record","integrity":"/paper/2507.16318/integrity","json":"/paper/2507.16318/citation-record.json","paper":"/paper/2507.16318"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:18.184990Z","title":"Effectiveness guided cross-modal information sharing for aligned rgb-t object de- tection","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.184990Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:6e9a30248865f7d09bc194c23b87aa6336332d98001ad38c6d40285c462ae84b","observation_id":"d9b9061a-8e35-4dd8-a0e7-a2880e2ba89e","resolution":{"observed_at":"2026-08-06T15:18:18.184990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13721","last_updated":"2023-07-25T17:59:18Z","snapshot_observed_at":"2026-08-07T23:40:08.386706Z","submitted_at":"2023-07-25T17:59:18Z","title":"Foundational Models Defining a New Era in Vision: A Survey and Outlook","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13721","snapshot_observed_at":"2026-08-06T15:18:18.279229Z","title":"Foundational models defining a new era in vision: A survey and outlook","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.279229Z"},"links":{"cited_paper":"/paper/2307.13721","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:5dfd8d1ce575018249338e2e8eab312d20b1f829ea024fb1bec4f1b553fd3af4","observation_id":"7717a507-3fb4-40c5-a3e1-20bf9bca7fa4","resolution":{"observed_at":"2026-08-06T15:18:18.279229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:18.410690Z","title":"Multimodal object detection by channel switching and spatial attention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.410690Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f3812b78a5769819a20320700c020a910f2768cc2e95d4e4c4a3261d15b51537","observation_id":"2ec73e11-a5bc-4b08-80b3-6fe007d9c075","resolution":{"observed_at":"2026-08-06T15:18:18.410690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:18.505207Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.505207Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:2fc0aca0952355f52822a4d019336cf338756296c036952a53def82f2518abe3","observation_id":"42cef2d4-d42c-4f30-8859-2e580c1e5d90","resolution":{"observed_at":"2026-08-06T15:18:18.505207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:47.193327Z","title":"Multimodal object detection via probabilistic ensembling","venue":null,"work_id":"6878997a-5c24-45f0-8169-f201a6b0cce8","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.572100Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:c5baeaa54e10934e83a0462e9cf151da3875db3a6e051dbb7f18ad7d57f7bb8e","observation_id":"915e9008-126a-43ac-916e-372473d97a64","resolution":{"observed_at":"2026-08-06T15:18:47.329749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.981682Z","title":"Feanet: Feature-enhanced atten- tion network for rgb-thermal real-time semantic segmenta- tion","venue":null,"work_id":"92c7ce3a-1700-4f29-be87-852b03233981","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.702177Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:60a6aaba84b5eb4aacab0d1fbf83339da61d33b0bc808dc5c2cee8207be2cc10","observation_id":"2fd196b7-715e-4461-9b78-751556277706","resolution":{"observed_at":"2026-08-06T15:18:47.093486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.814619Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"9606045a-6b88-432c-b6b5-26d085209bd2","year":2009},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.849628Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e69660f90f60a15a253a5f46512dfe30caba0dd32cb7a5098c9e573a3c2d6e70","observation_id":"62c236d1-1b71-4643-a9bb-66d887b11671","resolution":{"observed_at":"2026-08-06T15:18:46.900367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.632366Z","title":"Redfeat: Recoupling detection and description for multimodal feature learning.IEEE Trans- actions on Image Processing, 32:591–602, 2022","venue":null,"work_id":"f392dee0-47d0-4f2d-a383-51b4cad4217c","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:18.960595Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:bcee7c2b46c597f15609748df97fe2d0621b438b5c4ae04fda3dc382baee79a9","observation_id":"8e675778-c0fc-4c0b-9406-efc5896e4907","resolution":{"observed_at":"2026-08-06T15:18:46.724609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00360","last_updated":"2023-12-04T04:38:17Z","snapshot_observed_at":"2026-07-06T16:55:29.501535Z","submitted_at":"2023-12-01T05:50:44Z","title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","version":2},"cited_work":{"arxiv_id":"2312.00360","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.00360","snapshot_observed_at":"2026-08-06T15:18:30.014864Z","title":"Efficient Multimodal Semantic Segmentation via Dual-Prompt Learning","venue":"cs.CV","work_id":"eb1ab6ce-e099-4b28-8cb9-d493e247c76e","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.060825Z"},"links":{"cited_paper":"/paper/2312.00360","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:cc7a707d68fa6278ce844713905fce73b3122f7b352f79c183ffe5371e0c58ac","observation_id":"30295ddd-2af1-4985-a9fc-73c1f12c7b43","resolution":{"observed_at":"2026-08-06T15:18:30.100016Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T15:18:19.170342Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.170342Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:cf6123e143141f3c987a2100898998b593f40ba4cbe5f4a070b7d3bd505f715f","observation_id":"025d29a9-4691-4538-b17f-f432690ac330","resolution":{"observed_at":"2026-08-06T15:18:19.170342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.467483Z","title":"Siamese network for rgb-d salient object detection and beyond","venue":null,"work_id":"18881f2d-3adf-4d27-9816-0487fae92c3e","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.290356Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:7ccab0547eee7807b29dbe20199a58f9da1e7b51063f126d39057d7b7729d162","observation_id":"03e9db4b-97be-4cbc-815f-a867b13970b1","resolution":{"observed_at":"2026-08-06T15:18:46.542537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.326106Z","title":"Fusion of multispectral data through illumination-aware deep neural networks for pedestrian de- tection","venue":null,"work_id":"ef0a475e-daf0-4477-a150-d5a36e48050e","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.391466Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:ae65b4ea42db8fa6995186d35ad4f3318c7c2a2b1b14d72cdff63cb47d341c64","observation_id":"109bb509-30fc-4aee-a1fa-8b052dcf2c68","resolution":{"observed_at":"2026-08-06T15:18:46.395814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:46.176449Z","title":"Mfnet: Towards real-time se- mantic segmentation for autonomous vehicles with multi- spectral scenes","venue":null,"work_id":"e9189862-c8bb-497a-9548-8fa59567758f","year":2017},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.533671Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:6068c89ceb667e3063f4356f7f267f8510dd8287edf1ffafef28d487965ed548","observation_id":"17a801b4-a45f-42b1-9907-56facb25b838","resolution":{"observed_at":"2026-08-06T15:18:46.252155Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.992344Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"474a3960-c7eb-44d5-bb67-10063340e04d","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.633092Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:3c6ea010902b2773e7ea1d99033466041fb38ed81691d950c58d73a553edb45b","observation_id":"bbe3bad4-047d-430b-9f47-e6f8f1986a70","resolution":{"observed_at":"2026-08-06T15:18:46.062913Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.809893Z","title":"Multispec- tral object detection via cross-modal conflict-aware learning","venue":null,"work_id":"cccf24fa-f3cd-430e-8726-ea217634e163","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.775701Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9447254cbe30e5b3f1a4fa1024e31b7f0550d765f81191747b730c5087ec7f11","observation_id":"10fbabd0-9e40-499b-9510-59755331f869","resolution":{"observed_at":"2026-08-06T15:18:45.915744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.553788Z","title":"Spectralgpt: Spectral remote sensing foun- dation model","venue":null,"work_id":"d67663bc-7a95-4e76-93a7-16962de44b18","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:19.895866Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f5413d26d739c84b7ae71b3c3577aa812b65db6fdc441e340a81239ba42b29ca","observation_id":"0203e63c-d16e-4043-8900-799f191a4737","resolution":{"observed_at":"2026-08-06T15:18:45.674958Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06049","last_updated":"2022-12-19T19:21:47Z","snapshot_observed_at":"2026-08-04T03:24:23.267133Z","submitted_at":"2022-08-11T21:58:36Z","title":"MILAN: Masked Image Pretraining on Language Assisted Representation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.06049","snapshot_observed_at":"2026-08-06T15:18:20.058704Z","title":"Milan: Masked image pretraining on language assisted representation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.058704Z"},"links":{"cited_paper":"/paper/2208.06049","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:dddfeab99500c817c9096cfdf96caa4bb0cab9ef0b15ed71e117ffddac826dcb","observation_id":"df4b34dc-c368-40e4-a888-9abc382f43b2","resolution":{"observed_at":"2026-08-06T15:18:20.058704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.389579Z","title":"Pos-gift: A geomet- ric and intensity-invariant feature transformation for multi- modal images","venue":null,"work_id":"c485fbe6-7d6d-4cb1-922c-46ee350dd171","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.163393Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:b428faabb4665f70c84ad35dc0d8a3596e3be5c1411407c04912d0cc23495c6f","observation_id":"f1a167fb-9b71-4cf6-8e8b-2b2a90d831ea","resolution":{"observed_at":"2026-08-06T15:18:45.463015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.256825Z","title":"Multi-graph fusion and learning for rgbt im- age saliency detection","venue":null,"work_id":"dfe8726c-f24a-408b-9182-34f13807cceb","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.232566Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:672ca493d4a202abaebcc5a9748d8d716a8f6f285c9c56f9ff1983dbd69ebc08","observation_id":"5a43f7f9-9a80-4934-8b3f-c736c28887f3","resolution":{"observed_at":"2026-08-06T15:18:45.299389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:45.131154Z","title":"Multispectral pedestrian detection: Benchmark dataset and baseline","venue":null,"work_id":"22ee4ae3-96b9-4137-828e-09b25c52c8c7","year":2015},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:20.582198Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:4a86e5d7fef4aaeef248e20d058a8932cda1f0f60966d7a3c04df60ae5998c8b","observation_id":"f95a5d37-da2a-4085-9028-8841ad56268a","resolution":{"observed_at":"2026-08-06T15:18:45.211931Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.871378Z","title":"Multispectral pedestrian detection: Benchmark dataset and baseline","venue":null,"work_id":"4ced8b5c-97f6-42ab-9d69-bd5036fc99db","year":2015},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.309500Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:8652cbd48297f307e90599ab10ddf0838fc369a9775a88e99b4eee6543302e89","observation_id":"3e1274d6-9df0-462f-958f-a4ef46a3a77a","resolution":{"observed_at":"2026-08-06T15:18:45.010825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.561692Z","title":"Semanticrt: A large-scale dataset and method for robust semantic segmentation in multispectral images","venue":null,"work_id":"0fdfd366-476a-4eef-9301-8dd03b924a84","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.410685Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:337599e8467240c3051574f578e52a5fefc7a6510765ea862f88dd8be0854271","observation_id":"44c4dcd6-ea3c-4076-9662-45203f5ddaf9","resolution":{"observed_at":"2026-08-06T15:18:44.691650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.330752Z","title":"Multispectral video se- mantic segmentation: A benchmark dataset and baseline","venue":null,"work_id":"cb30dbcf-2785-4e60-877b-bc06d1203168","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.529022Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:ec7215773b659a8ecdf234d573ad0048bdf191cc1b41bd96f1bc4eb60db5d516","observation_id":"1c66585d-2008-42fc-9fc9-ec27c118435a","resolution":{"observed_at":"2026-08-06T15:18:44.460776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:44.141821Z","title":"Llvip: A visible-infrared paired dataset for low-light vision","venue":null,"work_id":"6877b779-2d7e-4500-9236-08684f2f21c0","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.666409Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:1726b9559c23ebe5c623757773663cac77531791a6bcdb6ae0d5805319565e54","observation_id":"d4a52f16-9b95-4f7d-97b0-77a412fd5b40","resolution":{"observed_at":"2026-08-06T15:18:44.235725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:21.781386Z","title":"What to hide from your students: Attention-guided masked image modeling","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.781386Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:3570299aee2dad89889b606fe7c683f057530e86a6a453e7633e84ed2213658b","observation_id":"5f30e859-c301-441d-b686-249456ff3293","resolution":{"observed_at":"2026-08-06T15:18:21.781386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.859663Z","title":"Crossformer: Cross-guided attention for multi-modal object detection.Pat- tern Recognition Letters, 179:144–150, 2024","venue":null,"work_id":"5465f169-8076-4413-966e-3ff6cc02b0fe","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:21.906719Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:8bc934975f357e4bd69264420cb73029391796601e89e1239c3f6b1e4055ce8b","observation_id":"67ac5a57-49c5-42ed-9968-3fd10733ecb2","resolution":{"observed_at":"2026-08-06T15:18:43.993881Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04818","last_updated":"2018-08-14T17:59:12Z","snapshot_observed_at":"2026-08-03T23:31:39.269403Z","submitted_at":"2018-08-14T17:59:12Z","title":"Multispectral Pedestrian Detection via Simultaneous Detection and Segmentation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.04818","snapshot_observed_at":"2026-08-06T15:18:22.045311Z","title":"Multispectral Pedestrian Detection via Simulta- neous Detection and Segmentation","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.045311Z"},"links":{"cited_paper":"/paper/1808.04818","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:2de2a5c100ae6b341174a51717ae3d6e5bf300f66b6634f8624eeb9b6a181873","observation_id":"3ac60b8e-4d10-4886-89dc-1a72608aafb1","resolution":{"observed_at":"2026-08-06T15:18:22.045311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.632652Z","title":"Lasher: A large-scale high- diversity benchmark for rgbt tracking.IEEE Transactions on Image Processing, 31:392–404, 2021","venue":null,"work_id":"bdc6d450-8da0-4886-98c7-7210c3f3f88b","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.212992Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:a3106c9031ba2ba7bdcf30b62dc875da6c7508d76efe4f8706f40bd46e8e52b8","observation_id":"5527eecf-5f18-4e7d-9635-927bd07f9bb0","resolution":{"observed_at":"2026-08-06T15:18:43.762151Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.418826Z","title":"Semmae: Semantic-guided mask- ing for learning masked autoencoders","venue":null,"work_id":"f0eeaada-8a7d-4ab1-8815-c1d905c7836b","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.432390Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:f9359186c4796917ff2f45112d38d30f6fd4a1cae683edd36a4b718e570f3481","observation_id":"fff28392-3014-48f4-84b1-fd0ba553e912","resolution":{"observed_at":"2026-08-06T15:18:43.514827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:43.203549Z","title":"Rift: Multi-modal image matching based on radiation-variation insensitive fea- ture transform","venue":null,"work_id":"989409bf-aa08-4db4-96fd-6073a46331a0","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.592268Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:c753479471a5d15e562e30c8505b6c5b7284b6405585fd76deb11748c4042401","observation_id":"e05d2c8a-4709-47bb-8b2c-b79f38793ad7","resolution":{"observed_at":"2026-08-06T15:18:43.317055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.925885Z","title":"Confidence-aware fusion using dempster- shafer theory for multispectral pedestrian detection","venue":null,"work_id":"ccff5ab7-f6b0-4486-a9d0-08ac1c3fff6c","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.732821Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0145302820aa613e85308698aa3ea951bb3359143530ce3220517a9dacd3b020","observation_id":"bd1b5fe3-f834-4c3b-9f21-5b931d74722e","resolution":{"observed_at":"2026-08-06T15:18:43.071769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.691238Z","title":"Saratr-x: Toward building a foundation model for sar target recognition","venue":null,"work_id":"9bb86964-b0c6-4d9e-b188-e9b87904b789","year":2025},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:22.919691Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:13b4224786dcd1d7be721b00a7719e87e755c8ded01505d6590cb3ac4e85064f","observation_id":"563676bb-3965-4bfc-803d-cd93c7df7745","resolution":{"observed_at":"2026-08-06T15:18:42.789636Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.496657Z","title":"Generalized focal loss: Learning qualified and distributed bounding boxes for dense object detection","venue":null,"work_id":"e664d4a0-dfb7-4867-8040-8ac6481c258b","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.132441Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:8bcb3e30b65abe8139d8ba9472264ae92b61970daad01595a5bbbef0fd8626d1","observation_id":"edcd953c-adcd-4ab7-b70c-1b5db1429871","resolution":{"observed_at":"2026-08-06T15:18:42.585309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.295140Z","title":"Exploring plain vision transformer backbones for object de- tection","venue":null,"work_id":"825feb03-7a5f-43c7-aa23-e1075d8f45f7","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.246815Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:fb44f86ada102b3d815bdd9f066fca36fcb32bb1080e3caf269d8bd35998a45d","observation_id":"c50aa9ce-3ee6-442c-b0f8-e4a251e5b94d","resolution":{"observed_at":"2026-08-06T15:18:42.395617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:42.050888Z","title":"Lightglue: Local feature matching at light speed","venue":null,"work_id":"33126ea5-9666-4acb-aa23-fe1ec8beac5d","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.356455Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:5a0f6256ae8f1ac76184d92f12b7037159ce469e5a8a0dab376fc6bc398b8689","observation_id":"0042fdba-0869-4dd0-8df5-8fe047c1bd76","resolution":{"observed_at":"2026-08-06T15:18:42.174865Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.794579Z","title":"Infmae: A foundation model in the infrared modality","venue":null,"work_id":"8616b891-bc20-405e-b1de-f7c6224c0230","year":2025},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.478882Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:adf8b8f946d19840c567355c43d47153114199d4cd0dfa12c97b5fac191d4d90","observation_id":"c484f5b8-07bb-48c6-bd19-fa53a0901cdb","resolution":{"observed_at":"2026-08-06T15:18:41.895390Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.02644","last_updated":"2016-11-08T18:22:31Z","snapshot_observed_at":"2026-08-04T02:43:34.248041Z","submitted_at":"2016-11-08T18:22:31Z","title":"Multispectral Deep Neural Networks for Pedestrian Detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.02644","snapshot_observed_at":"2026-08-06T15:18:23.608139Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.608139Z"},"links":{"cited_paper":"/paper/1611.02644","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:fdaae1e5b687a0d6ef929137b6681586a5e9fdf2faafab18574654c96253358c","observation_id":"36e7c057-4f64-4e7c-a860-f50fa0404027","resolution":{"observed_at":"2026-08-06T15:18:23.608139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.564767Z","title":"Multi- interactive feature learning and a full-time multi-modality benchmark for image fusion and segmentation","venue":null,"work_id":"3d1869f6-b773-4f29-baa6-31537864757a","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.717102Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e80405b20cea96631a5c350e3eda8bdded8e2316a47ef37136640f3e2d2b01ab","observation_id":"9c0ef9fe-54dd-4b62-bfe6-aec2699223e1","resolution":{"observed_at":"2026-08-06T15:18:41.673417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.336277Z","title":"Learning selective self-mutual attention for rgb-d saliency detection","venue":null,"work_id":"4281a5db-9361-40f3-ad18-86a340f28b67","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:23.848618Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d0ad1c6edbc29df384243610254acfd0d29f3747c9b38e99fbf7e85d73124ed8","observation_id":"972a2357-ebac-4d18-81ad-d9e012dabff3","resolution":{"observed_at":"2026-08-06T15:18:41.426726Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:41.054975Z","title":"Local memory attention for fast video semantic segmentation","venue":null,"work_id":"f7a3bf1f-ddcb-4b48-babc-5c241569a7e4","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.011554Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:b997b6fca9ceff1ead2d44e2be7a28846908797634797084ecf0b2e304b5a8ea","observation_id":"30504827-507e-4a7a-8508-0841cd5a7a3c","resolution":{"observed_at":"2026-08-06T15:18:41.177473Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00273","last_updated":"2022-10-04T09:52:39Z","snapshot_observed_at":"2026-07-06T12:03:45.415112Z","submitted_at":"2021-10-30T15:34:12Z","title":"Cross-Modality Fusion Transformer for Multispectral Object Detection","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00273","snapshot_observed_at":"2026-08-06T15:18:24.156472Z","title":"Cross- modality fusion transformer for multispectral object detec- tion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.156472Z"},"links":{"cited_paper":"/paper/2111.00273","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:36d173c7add8503dfbcd82fdff348ede5312aaba0cb1140a68d6870173344fb8","observation_id":"a5d55659-dcd5-4852-bd93-63da4a9ddcbb","resolution":{"observed_at":"2026-08-06T15:18:24.156472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.775555Z","title":"Icafusion: Iterative cross-attention guided feature fusion for multispectral object detection","venue":null,"work_id":"71fd2f0e-4252-4695-a662-6706b3102b6a","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.255143Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:12c27d2a15598e0bc4409a2fb27e6b8b5be6dd9f92ec840987861526b5ee411c","observation_id":"8d6e959a-60eb-4823-912f-0e117f12e489","resolution":{"observed_at":"2026-08-06T15:18:40.930122Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.470526Z","title":"Pst900: Rgb- thermal calibration, dataset and segmentation network","venue":null,"work_id":"e9ccf68e-03a8-400c-ac1f-7aae4bcb06ca","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.353550Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:6e422d37e9b739a34b1759b49b262ffb4ecfcca629d34a35d04aa8f7dc78c965","observation_id":"d582a157-e34e-49b4-9e39-745415916cf7","resolution":{"observed_at":"2026-08-06T15:18:40.655928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.227452Z","title":"Multiple graph affinity interactive network and a variable il- lumination dataset for rgbt image salient object detection","venue":null,"work_id":"dfd8780d-5834-4856-82c2-f4402650c07d","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.432926Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:02fff4975ce00018a7390b79af6f01f65fefd96ca4d569a5eea0d9d2129eab57","observation_id":"a3716968-bce4-4e4f-8e72-92fac309ea3c","resolution":{"observed_at":"2026-08-06T15:18:40.351365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:40.011468Z","title":"Loftr: Detector-free local feature matching with transformers","venue":null,"work_id":"9e41e264-7ec7-42bb-8b4a-529a7c46f4f2","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.535469Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:70542845cd02947fc5640c37b0298993601912f3c9a9fe39fffd6cf9fb6091a0","observation_id":"776100b1-d643-45d7-a2b4-f37807387d8d","resolution":{"observed_at":"2026-08-06T15:18:40.130789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.778082Z","title":"Rtfnet: Rgb- thermal fusion network for semantic segmentation of urban scenes","venue":null,"work_id":"d17c3115-0867-48f3-91b6-b3cdcebee185","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.604516Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:5f040c449b7c1030ad0746dc2b8ffffbdfdf322de50a716695804495dd1a7930","observation_id":"32fce89f-08d6-41dc-94f4-0675c2edd515","resolution":{"observed_at":"2026-08-06T15:18:39.905351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.556160Z","title":"Rgb-t image saliency detection via collaborative graph learning","venue":null,"work_id":"bce2c435-51cf-40a1-8159-a0ff9dd28898","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.740161Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:ce5ff52f12de11a12d2dcd6f8492eeebeb2b3b79677e626a32e228a105c4c347","observation_id":"6fc6d81c-ad99-4029-9200-7c326f2fd918","resolution":{"observed_at":"2026-08-06T15:18:39.675386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.269592Z","title":"Multi-interactive encoder-decoder network for rgbt salient object detection","venue":null,"work_id":"070de9aa-15a0-45fe-a300-be8b2cb38944","year":2005},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.852425Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:a8c850d04d05739d6c16911042b552600c8472ded4e0e6d6d415896420d78797","observation_id":"d630c9da-6def-423e-9bc9-a49c7524eec9","resolution":{"observed_at":"2026-08-06T15:18:39.381149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:39.019680Z","title":"Multi-interactive dual-decoder for rgb-thermal salient object detection","venue":null,"work_id":"cf4b7e45-ae61-458c-91e3-8a119a1b6132","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:24.978333Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:9a7bcb66ca51880fc596aa41c2e145c57b39ff853d7371dbe0407f27a5a2a601","observation_id":"30e3c5c7-992c-4cc5-a8d4-be8b5031ff76","resolution":{"observed_at":"2026-08-06T15:18:39.121305Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.749380Z","title":"Rgbt salient object detection: A large- scale dataset and benchmark","venue":null,"work_id":"2ca945a8-7e8a-4229-b031-7ea7a0404d9a","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.121344Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:235b3d6758c38c4a72edd611fd429e3034beec0202e0371d3a2ec2f95f99e690","observation_id":"8bbca9b8-ee32-4517-baa1-4cfb2090089e","resolution":{"observed_at":"2026-08-06T15:18:38.875618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11519","last_updated":"2025-04-01T15:14:22Z","snapshot_observed_at":"2026-08-06T14:39:53.951215Z","submitted_at":"2024-06-17T13:22:58Z","title":"HyperSIGMA: Hyperspectral Intelligence Comprehension Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11519","snapshot_observed_at":"2026-08-06T15:18:25.256613Z","title":"Hypersigma: Hyperspectral intelligence comprehen- sion foundation model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.256613Z"},"links":{"cited_paper":"/paper/2406.11519","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:88e549d86f4588ab24dd76bf8b65e1682373062af424f5363d65b082ca850eed","observation_id":"5dc56d59-87ee-4aaf-ab42-ccc56ebdaa86","resolution":{"observed_at":"2026-08-06T15:18:25.256613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.497356Z","title":"Rgb-t saliency detection benchmark: Dataset, baselines, analysis and a novel approach","venue":null,"work_id":"9fc4dbda-295e-45a8-b4b2-1ee379b5344f","year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.361056Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0b2422ba9bcddde099add6d57b875d670ca19c8e2155b08c67101dd91d548bc9","observation_id":"f09950fe-abe2-450f-a846-8bbd5640dbed","resolution":{"observed_at":"2026-08-06T15:18:38.632384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.261168Z","title":"Hard patches mining for masked image modeling","venue":null,"work_id":"970f1436-c0a1-4dd0-b9f9-cefaa4ab4ffb","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.472691Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:393428c05429e9e76a8eb850eb41141093c19df6001135ccd5c99bf73154cec6","observation_id":"024a49df-aa54-4800-a2f0-333b8870a7b0","resolution":{"observed_at":"2026-08-06T15:18:38.378331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:38.015804Z","title":"Cgfnet: Cross-guided fusion network for rgb-t salient object detection","venue":null,"work_id":"8aee84bc-d0cb-4551-b4ed-116bb42d702f","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.575977Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:c35fd8034d26b5b36acf6fe2a99f4972999e42c9e6bd38d78c5694a34cab35db","observation_id":"7603ebba-8587-4178-8ce1-524f341f7502","resolution":{"observed_at":"2026-08-06T15:18:38.105423Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.715226Z","title":"Sgfnet: semantic- guided fusion network for rgb-thermal semantic segmenta- tion","venue":null,"work_id":"0446b6af-475e-4b4b-b5ad-a6233cbf165f","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.704948Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:dd59e875615344d9f851dacffc3005d80dd3ed2d3b05757f7347d7b9bc3a7459","observation_id":"a28973bb-fe66-46eb-a802-489d1fc0e1b5","resolution":{"observed_at":"2026-08-06T15:18:37.892776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.569590Z","title":"Image quality assessment: from error visibility to structural similarity","venue":null,"work_id":"bb78ee1d-2633-4630-9bf9-1813b417f83d","year":2004},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:25.840867Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:21dd8a83d7a215c1ce43e2bd0082ca4df018d98514df720f9dcde594917106a8","observation_id":"a24eeddd-b2de-4b8b-b410-7103df39f119","resolution":{"observed_at":"2026-08-06T15:18:37.664248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.428482Z","title":"Tirdet: Mono-modality thermal infrared object detection based on prior thermal-to-visible translation","venue":null,"work_id":"2f67f6d6-aabe-4d36-8b8c-0280ad02ef91","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.016052Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:4e3f2cf78ab83713bf02689d8f2045d57df6ace10ab6fee0c40ec97be1fb52f5","observation_id":"74c62848-1178-469d-aa86-4d5e55365856","resolution":{"observed_at":"2026-08-06T15:18:37.511343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14338","last_updated":"2022-05-28T05:13:45Z","snapshot_observed_at":"2026-08-04T15:57:36.158746Z","submitted_at":"2022-05-28T05:13:45Z","title":"Object-wise Masked Autoencoders for Fast Pre-training","version":1},"cited_work":{"arxiv_id":"2205.14338","doi":null,"metadata_source":"pith","pith_arxiv_id":"2205.14338","snapshot_observed_at":"2026-08-06T15:18:29.810919Z","title":"Object-wise Masked Autoencoders for Fast Pre-training","venue":"cs.CV","work_id":"feab7c0c-297f-4f80-bf61-409c1d310204","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.176581Z"},"links":{"cited_paper":"/paper/2205.14338","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:0b38a1a8e36745cee892ff8ba097a633fd1438872f652545969d2625d59f85fd","observation_id":"15c2c8d7-3e35-4e04-924a-2f33a8fa8882","resolution":{"observed_at":"2026-08-06T15:18:29.861145Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.202101Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"e349c55d-fe7e-468c-b8a5-d30f62399c71","year":2018},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.304589Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:4eb622f74ccb4413e63e048781b0ca843cda7b90c25500365bb4e5ba0e4c3742","observation_id":"4a368247-c597-4ba8-b320-6bf730b51a53","resolution":{"observed_at":"2026-08-06T15:18:37.301348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:37.055901Z","title":"Early convolutions help trans- formers see better","venue":null,"work_id":"751c2a03-d4fd-4096-a611-3f8d7bb8b61b","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.420932Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:cb187a0bcf54a922b4b9bbec3b5ae0e225132bc27e129d08784cb34ff79f98dc","observation_id":"7b9bceae-6945-4ab4-a6e7-ff13b4b1149a","resolution":{"observed_at":"2026-08-06T15:18:37.121789Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:36.719209Z","title":"Segformer: Simple and efficient design for semantic segmentation with transform- ers","venue":null,"work_id":"217eca0e-dc59-4806-94fb-29df3a9955e3","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.509897Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:581b392623c554427eaff179de3b6d1c1f365372c7e6f876be03606f421008ff","observation_id":"f9232427-c256-4bee-813b-835b78a47631","resolution":{"observed_at":"2026-08-06T15:18:36.863317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:36.333832Z","title":"Semantics lead all: Towards unified image registration and fusion from a semantic perspective","venue":null,"work_id":"f1144adb-ef92-4902-bed6-c3630c417f04","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.578515Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:fc0df1712b3a3fdffcb16c1c6a02d43301c1e5c76877cc8ad026c05c87b8ceae","observation_id":"0c3b6c3a-630b-41e7-9f8a-6b99ea317684","resolution":{"observed_at":"2026-08-06T15:18:36.560050Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05237","last_updated":"2024-05-08T17:33:42Z","snapshot_observed_at":"2026-08-06T01:59:01.455119Z","submitted_at":"2024-05-08T17:33:42Z","title":"EVA-X: A Foundation Model for General Chest X-ray Analysis with Self-supervised Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05237","snapshot_observed_at":"2026-08-06T15:18:26.731053Z","title":"Eva- x: A foundation model for general chest x-ray analysis with self-supervised learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.731053Z"},"links":{"cited_paper":"/paper/2405.05237","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:580992283ee585949a36c4b649c0c092c6b244da0837a45cba8ed96b2800cc15","observation_id":"64f4db7f-071b-4cb7-92fc-cb493c9e21da","resolution":{"observed_at":"2026-08-06T15:18:26.731053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:35.885932Z","title":"C 2 former: Calibrated and complementary transformer for rgb-infrared object de- tection","venue":null,"work_id":"fcd711fb-a074-42c6-9dc1-223421542f8d","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.879020Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:3ffb6a45f075642ce3fc0dd77d751ff76f4cd95a9bd1966a063b03928ec43cfd","observation_id":"59ce5e09-8054-4f2d-bbc6-b0337172aecf","resolution":{"observed_at":"2026-08-06T15:18:36.116926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:35.549568Z","title":"Transla- tion, scale and rotation: cross-modal alignment meets rgb- infrared vehicle detection","venue":null,"work_id":"ff0f8cae-9198-4f40-ae92-384ac69023a1","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:26.946437Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:4e697313a02554b7983e231c55c6222cee602b529764b0ce5e06d502c0dc1483","observation_id":"0467d0d4-8753-4ed1-95f9-9ddf6a6133ab","resolution":{"observed_at":"2026-08-06T15:18:35.734915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2404.17360","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:29.678626Z","title":"Unirgb-ir: A unified framework for visible-infrared downstream tasks via adapter tuning","venue":null,"work_id":"0d20d2b4-ac9b-43f1-91aa-d4d600d5d304","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.007889Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:1827b1755431706129ee0355af51aa52dd515361ca51c97f48dcd8f8293fbbd8","observation_id":"831590ef-624c-4a47-90b3-e37e25b2a22b","resolution":{"observed_at":"2026-08-06T15:18:29.718363Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:35.269749Z","title":"Improving rgb-infrared object detection with cascade alignment-guided transformer","venue":null,"work_id":"3e7d3b16-58c9-4773-9809-e033cbed8ba4","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.149417Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:a767fb09de788dceabf309861aa481a264deb6bf2f8ad696ef3fab67199d4243","observation_id":"eec78eaa-d9a0-428a-88dc-d44e17dc9880","resolution":{"observed_at":"2026-08-06T15:18:35.406625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:34.878848Z","title":"Object- contextual representations for semantic segmentation","venue":null,"work_id":"42fdceba-d093-4158-becb-02ae86f26815","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.271528Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:16fbf9949eb70280808800a8824369038c6ca4dea45abe91ccf4a8a79cf615f1","observation_id":"87d4dd14-b968-4528-b75d-f014502e9b0a","resolution":{"observed_at":"2026-08-06T15:18:35.106773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:34.530753Z","title":"Infusion-net: inter-and intra-weighted cross-fusion network for multispectral object detection","venue":null,"work_id":"cbb8e08e-4483-4c5e-938e-055032ea137f","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.406381Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:60a80adb0b22297f00c018f905aa62d6e02071044ce57bf28ed32fd02ddf2e3b","observation_id":"e0e15432-f5c6-4268-be9c-607cb5c03fdc","resolution":{"observed_at":"2026-08-06T15:18:34.715000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:34.201766Z","title":"Mmi- det: Exploring multi-modal integration for visible and in- frared object detection","venue":null,"work_id":"627a99b9-a41b-416d-b770-65b6807f6e0b","year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.554499Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:5ac9968af12ae7aa2d217844842183d72e9bfad8d4528a4dfec46c3ee0ef5303","observation_id":"3c063278-dccc-4cc2-925c-d0955f70e683","resolution":{"observed_at":"2026-08-06T15:18:34.368260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:33.758227Z","title":"Multispectral fusion for object detection with cyclic fuse-and-refine blocks","venue":null,"work_id":"711a0c3d-3779-4660-a968-846b13356abd","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.635121Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:d462d0d52695c3668496fe0b8753dcc6f1884c8d2e884b1a5e25a7ab5d1f7f0c","observation_id":"b0a73ca1-a70c-4b45-a99d-9596c0c2c4ee","resolution":{"observed_at":"2026-08-06T15:18:33.989968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:33.455473Z","title":"Guided attentive feature fusion for multispectral pedestrian detection","venue":null,"work_id":"7261a37d-5dc6-4857-bb8b-ace0a6893174","year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.785278Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:119ccf552fb00ddf09dc7dd28f24cb4c9a6d2ac3d0b9dc8a6577b5a1e0a210b7","observation_id":"2a09ccab-ace5-4d36-ae25-8fa12e1a4c4f","resolution":{"observed_at":"2026-08-06T15:18:33.605120Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:33.010558Z","title":"Mrfs: Mutually reinforcing image fusion and segmenta- tion","venue":null,"work_id":"313d4c27-1449-4d4e-a404-27cbb52271eb","year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.901089Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:76530cdb798892fa046f31cb1820eb5125794cf402b3f0867e73a05d5e15834f","observation_id":"e508ce9f-90dd-4767-bd80-5897bd21aa4e","resolution":{"observed_at":"2026-08-06T15:18:33.226818Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:32.673391Z","title":"Cross-modality interactive attention network for multispectral pedestrian de- tection","venue":null,"work_id":"0c5dcfba-72cb-4ff3-aa17-51197debf1e3","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:27.972828Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:a876100d8916e6228466b739f182703e37f3cd4030b6ea8e91e8ed60a60c4d86","observation_id":"bc50c436-24c7-411b-bf00-06be44d6474b","resolution":{"observed_at":"2026-08-06T15:18:32.860243Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.02645","last_updated":"2019-10-18T11:57:50Z","snapshot_observed_at":"2026-08-08T23:48:08.565622Z","submitted_at":"2019-01-09T09:16:36Z","title":"Weakly Aligned Cross-Modal Learning for Multispectral Pedestrian Detection","version":2},"cited_work":{"arxiv_id":"1901.02645","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.02645","snapshot_observed_at":"2026-08-06T15:18:29.385077Z","title":"Weakly Aligned Cross-Modal Learning for Multispectral Pedestrian Detection","venue":"cs.CV","work_id":"ae547d0a-fd06-424c-8d32-666181a7bb56","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.133129Z"},"links":{"cited_paper":"/paper/1901.02645","citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:65be68c9a4e46e1c1d954225b69a15f944fa14121506e13c9fb1faa837dafefa","observation_id":"d04d0ff7-1777-4a39-bc79-5698ff7b9a2e","resolution":{"observed_at":"2026-08-06T15:18:29.505739Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:32.311063Z","title":"Rgb-t salient object detec- tion via fusing multi-level cnn features","venue":null,"work_id":"17a212a9-c562-48d8-9dd9-bc122986868b","year":2019},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.246384Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:c0184dcbae0a9cdafeabf97f4699766baa0131558a5e5ac939186f4040791df2","observation_id":"391600ba-f51e-480c-8fbf-33c7e0561770","resolution":{"observed_at":"2026-08-06T15:18:32.454652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:31.956490Z","title":"Abmdrnet: Adaptive-weighted bi-directional modality difference reduc- tion network for rgb-t semantic segmentation","venue":null,"work_id":"dc6906a7-2f08-4a0a-b1f1-2e76da857f53","year":2021},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.396941Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:dbbd2c41c40dee8960d270453548fefd24cbad2730a970000bf799c040ecac90","observation_id":"8757a2cd-11ce-46cb-9ef0-80fd68d9521c","resolution":{"observed_at":"2026-08-06T15:18:32.123937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:31.645983Z","title":"Mitigating modality discrepancies for rgb-t semantic segmentation","venue":null,"work_id":"99cf9f10-f150-47a9-a41b-32c2664499c6","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.527189Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:1f4c640fb3976e5d60c945985aeab5c89bb75b5050dcaafc225687e533ca83e5","observation_id":"30c6e76e-b3c0-44ee-8957-ed37199f0b75","resolution":{"observed_at":"2026-08-06T15:18:31.790123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:28.642748Z","title":"Removal and selection: Improving rgb- infrared object detection via coarse-to-fine fusion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.642748Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:968c36a6135489f0784452f682a770a6d5aaac34ddcf12fa4a78bc570a3e4cc3","observation_id":"c12d4dd0-bca8-4488-886b-0f1f079df8dc","resolution":{"observed_at":"2026-08-06T15:18:28.642748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:31.304806Z","title":"Improving mul- tispectral pedestrian detection by addressing modality im- balance problems","venue":null,"work_id":"72402332-1541-44c2-9718-fe49abcb8f95","year":2020},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.776174Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:353631cf155fd64d4ae8b22d64c2bf99f424d6b5b77a79a0182d2f1bfa49e297","observation_id":"3b868b17-7682-41a9-a6e1-9c2411a61bbc","resolution":{"observed_at":"2026-08-06T15:18:31.466248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:30.962533Z","title":"Mffenet: Multiscale feature fusion and en- hancement network for rgb–thermal urban road scene pars- ing","venue":null,"work_id":"bfa18d05-0aff-49c8-8b14-a8c905d4452a","year":null},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:28.905138Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:e49c11b955f8f693ac4aea1c81ac606b80afce449a898dc986f120c943f30be7","observation_id":"2cfb41fc-6e96-4efc-a9c8-520ce44f45cf","resolution":{"observed_at":"2026-08-06T15:18:31.114531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:30.610290Z","title":"Edge-aware guidance fusion network for rgb–thermal scene parsing","venue":null,"work_id":"b74533db-1ade-4f35-a81b-4ef719d33ced","year":2022},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:29.016668Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:aeddc7a5755527874c12d4e9977f0cf32df63b1da2546ede9d187b16237ab431","observation_id":"512aba2d-5ce0-4b5f-9dcf-0a5b97ad51a5","resolution":{"observed_at":"2026-08-06T15:18:30.753979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:18:30.240866Z","title":"Lsnet: Lightweight spatial boosting network for de- tecting salient objects in rgb-thermal images","venue":null,"work_id":"da95af1a-09e5-4cb5-89a8-aa94a0fe9c52","year":2023},"citing_paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-06T15:18:29.140260Z"},"links":{"citing_paper":"/paper/2507.16318"},"observation_digest":"sha256:411db7f329a3d2acd412bf77494e2bba7c8b5ac38e5ca532aa84064407ff95de","observation_id":"3ac11f5a-79bc-48e8-84f8-6ee4fe43939c","resolution":{"observed_at":"2026-08-06T15:18:30.437447Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.16318","last_updated":"2025-07-28T07:25:40Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T23:40:52.151243Z","submitted_at":"2025-07-22T08:00:49Z","title":"M-SpecGene: Generalized Foundation Model for RGBT Multispectral Vision"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":13,"verified_exact":4,"verified_fuzzy":66},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 0 inbound Pith citation observations for arXiv:2507.16318."}