{"as_of":"2026-08-13T18:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2a8661d2e5a8c65bf77567ab16c335f676b40314eb4f0821350be8bf54bc2475","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-18T16:28:48.494939Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T10:27:20.578105Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.15642","snapshot_observed_at":"2026-08-01T10:27:20.578105Z","title":"UNIV: Unified foundation model for infrared and visible modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20238","last_updated":"2026-07-22T14:59:02Z","snapshot_observed_at":"2026-08-07T20:22:50.050480Z","submitted_at":"2026-07-22T14:59:02Z","title":"Not All Patches are Equal: Sampling Matters for Visible-Infrared Pre-Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T10:27:20.578105Z"},"links":{"cited_paper":"/paper/2509.15642","citing_paper":"/paper/2607.20238"},"observation_digest":"sha256:018b600153eaac73ac91734aab5218a8dff5710e273dc9ee1eba0f0198aacaed","observation_id":"5d2a49d0-3772-4110-b706-4cb64ef106b9","resolution":{"observed_at":"2026-08-01T10:27:20.578105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2509.15642/citation-record","integrity":"/paper/2509.15642/integrity","json":"/paper/2509.15642/citation-record.json","paper":"/paper/2509.15642"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://github.com/ultralytics/ultralytics","venue":null,"work_id":"6785c728-6029-45c6-9d03-73f455709d7f","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:2b137c1fca2a3818348e446771fd8e50eb213bbb15850753e5838b65b9ba2f96","observation_id":"7b883189-b104-42b9-a5d1-35a47287ce9f","resolution":{"observed_at":"2026-05-18T16:31:38.564399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-supervised learning from images with a joint-embedding predictive architecture","venue":null,"work_id":"433c54df-2a6c-463e-8619-30cff0871235","year":2023},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:29fbc7c182b4fb048cecfc10e11534c22f1e1c0327939c176216e1e42e975174","observation_id":"80dd73f5-dbb2-454c-a8e1-92152eaf5756","resolution":{"observed_at":"2026-05-18T16:31:38.576943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"End- to-end object detection with transformers","venue":null,"work_id":"a9ef11d3-d51c-4db2-8b9b-caca597a68de","year":2020},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:6340f6e45d1a826449c2957961f9595f12d7122b4bf2398cde8ca5e2591fdd5c","observation_id":"fc574d61-9aea-4975-b4f1-62b4c9830e81","resolution":{"observed_at":"2026-05-18T16:31:38.579698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Emerg- ing properties in self-supervised vision transformers","venue":null,"work_id":"ec7926ea-91be-4e9d-91ac-2da963e8b9a5","year":2021},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:48c06dc7f510a8e757a38f7b85c8d70b7e22eab4c59d35f3d11279812718b769","observation_id":"a526a00f-a6b0-46a8-ac96-10b9b0767899","resolution":{"observed_at":"2026-05-18T16:31:38.582665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Encoder-decoder with atrous separable convolution for semantic image segmentation","venue":null,"work_id":"cdc8c119-c171-41b8-b17e-bd4e5dfc70d4","year":2018},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:f258faccccb8e1c1eb424331c2d2e434ccef09f4862c30a62fbe9a94626ca3f7","observation_id":"ff014e28-f218-460a-a748-ec74bab49fcc","resolution":{"observed_at":"2026-05-18T16:31:38.573402Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empiri- cal study of training self-supervised vision transformers","venue":null,"work_id":"06045148-6d40-4bad-bd6d-c6e7f87ef665","year":2021},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:0f6366a9208596c1a859efe8dd0b6bf6cdab18f8e9ef03993200f29759603e3e","observation_id":"7302c942-5950-499b-a37c-041edcc9d880","resolution":{"observed_at":"2026-05-18T16:31:38.561437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tagging before alignment: Integrating multi- modal tags for video-text retrieval","venue":null,"work_id":"0faeaa0b-9ddb-4456-8ca6-c3c821e86e1b","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:67129610bd55a23b0090e3a0c35a467f981700b4322657757dce5193aa38d6b2","observation_id":"5ba99090-640a-4adc-9bab-5f7657fcc4db","resolution":{"observed_at":"2026-05-18T16:31:38.570775Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning a similarity metric discriminatively, with application to face verification","venue":null,"work_id":"99126f1e-8248-401b-99af-d85160476ae1","year":2005},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:42b364a653b885e89af35768b84469d27882e248296c26a8ebcff8f29ddacfef","observation_id":"c33a4ad2-9401-4d77-935b-1f9285ffaea0","resolution":{"observed_at":"2026-05-18T16:31:38.567439Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"f9b8feab-304e-4e60-b985-f3eff51f6e8b","year":2009},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:1be18937242e26c73f75724eeac61c7505b532348bc8568caeb794f97601dbd9","observation_id":"e6dedf02-82dc-41ff-8e79-68d447217abd","resolution":{"observed_at":"2026-05-18T16:31:38.558694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":"1810.04805","doi":"10.1111/jofi.12885","metadata_source":"pith","pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","venue":"cs.CL","work_id":"ed240a10-5b19-406c-baa5-30803f465785","year":2018},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:72885e957245c1f7e108345608819dc692a24b56f975b29df815ca75fad29463","observation_id":"4ff63ccc-9812-40a3-bf1f-492d26fa70d9","resolution":{"observed_at":"2026-05-18T16:31:37.143616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T14:19:26.598265Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":"2010.11929","doi":"10.1175/jcli-d-22-0357.1","metadata_source":"pith","pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","venue":"cs.CV","work_id":"e96730e3-129b-4db6-b981-15ab7932e297","year":2020},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:c715cd022fd4afc6ccec648c01439baed05d90486f0e3d55b12f718c2457c831","observation_id":"4b2b1fdb-cb07-44e4-ae85-d5fc04451865","resolution":{"observed_at":"2026-05-18T16:31:37.180208Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Flir thermal dataset version 1.3 [dataset]","venue":null,"work_id":"129642d3-eddb-455e-93b5-de9339f6219b","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:bfe25f9b86dcbe126d2bf1943f274edc00b9787a67c6d3889b2091961ad0c412","observation_id":"95a9f9d2-43b0-43f6-8dd1-3f4dac6969a9","resolution":{"observed_at":"2026-05-18T16:32:45.373282Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"40ec34a1-fdca-4fe0-9a71-b94c879aecdd","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:c633d13418c6ac8f28c7e4581b7a7f754f7460d3bb1b31eb07c44217418aeb5f","observation_id":"fd48258d-c686-4772-aeea-480187373199","resolution":{"observed_at":"2026-05-18T16:32:45.391805Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Catastrophic forgetting in connectionist networks.Trends in cognitive sciences, 3(4):128–135","venue":null,"work_id":"f5a3bb06-706f-4fe2-9b4f-e543bcd02811","year":1999},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:25a22fb088b54cf468608095d9d0191023ba528db697f96c85fc71eb581e3ee1","observation_id":"4fb88795-19fd-455e-a07d-0bbefa7858d2","resolution":{"observed_at":"2026-05-18T16:32:45.384910Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.03892","last_updated":"2022-05-19T16:28:37Z","snapshot_observed_at":"2026-08-13T15:48:10.912957Z","submitted_at":"2022-05-08T15:12:19Z","title":"ConvMAE: Masked Convolution Meets Masked Autoencoders","version":2},"cited_work":{"arxiv_id":"2205.03892","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.03892","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Convmae: Masked convolution meets masked autoencoders","venue":null,"work_id":"bb793e1f-8a06-4ac9-801d-cadbfd24cd93","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2205.03892","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:f9d02b948bd76342a54cf8394aed4b997977000fa281aeac4da8fa6503bab04c","observation_id":"53301122-e33a-4ca9-8e36-8d2968edc846","resolution":{"observed_at":"2026-05-18T16:31:37.170898Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mfnet: Towards real-time se- mantic segmentation for autonomous vehicles with multi- spectral scenes","venue":null,"work_id":"faa8afcd-43a6-4553-805e-3db40bcf80f2","year":2017},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:38023947d016a2f660308fbd0eee116cc0c0a3a5ae52b0998e01c5ae54ee310c","observation_id":"3b11516e-3565-4532-81b2-48b21306eb97","resolution":{"observed_at":"2026-05-18T16:32:45.401635Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mask r-cnn","venue":null,"work_id":"9d2c2954-c262-4370-b68f-a0396d241ec9","year":2017},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:69303639322b8faed55983537fbb97ead158fb6b00791fcc2049403f23a42286","observation_id":"129afbed-c491-4414-b7ad-14c51a39ea75","resolution":{"observed_at":"2026-05-18T16:32:45.398520Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"5f52ea64-e7dc-440d-861e-acc588d5adb6","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:939b6954d86cef0e5b5f9efcf2aa116d9021875e54b748088dee8099e3876325","observation_id":"499f363c-40fe-489a-a385-fa2c98a46f06","resolution":{"observed_at":"2026-05-18T16:32:45.368227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vic-mae: Self-supervised representation learning from im- ages and video with contrastive masked autoencoders","venue":null,"work_id":"9378d227-a2a6-4002-afce-05b2f032ddcd","year":2024},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:43835733234193128fdf1b2c702c45132e5d2cb160a002c0357b226ce0f480e0","observation_id":"d694142c-0bbd-44cf-974d-9455684d00d3","resolution":{"observed_at":"2026-05-18T16:32:45.351203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.06049","last_updated":"2022-12-19T19:21:47Z","snapshot_observed_at":"2026-08-13T14:46:55.775257Z","submitted_at":"2022-08-11T21:58:36Z","title":"MILAN: Masked Image Pretraining on Language Assisted Representation","version":3},"cited_work":{"arxiv_id":"2208.06049","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.06049","snapshot_observed_at":"2026-07-01T09:45:40.100636Z","title":"Milan: Masked image pretraining on language assisted representation","venue":null,"work_id":"9453d372-97b4-4dc5-b277-5ec4a208add8","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2208.06049","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:c24b55f46134d33102e38ae825f08251b134fc8578be7686a9479e0d339859c1","observation_id":"539bfa7c-0004-4261-a864-e53e8b78d681","resolution":{"observed_at":"2026-05-18T16:31:37.148483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12273","last_updated":"2019-07-30T06:33:46Z","snapshot_observed_at":"2026-07-06T08:10:51.630781Z","submitted_at":"2019-07-29T08:33:32Z","title":"Interlaced Sparse Self-Attention for Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"1907.12273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.12273","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Interlaced sparse self-attention for semantic segmentation","venue":null,"work_id":"18973061-3801-4bbb-9c47-b7711d3e1bff","year":1907},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/1907.12273","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:8c1fe867831e943962f109303dae3d89b1dc7b8396212a5597d25f7adb1f54db","observation_id":"2fc8c05f-8cba-498c-93cf-0c9663f1fd1d","resolution":{"observed_at":"2026-05-18T16:31:37.161675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multispectral pedestrian detection: Benchmark dataset and baseline","venue":null,"work_id":"85e30638-9af1-438b-a8da-2f8b1cf5c81d","year":2015},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:da2292ddc2c68c02c61f9c73cdb2cf7c66140bd94040e55c3cd8a7f618a05005","observation_id":"670986c7-6e40-4952-979e-7b0a041f4b73","resolution":{"observed_at":"2026-05-18T16:32:45.354290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Llvip: A visible-infrared paired dataset for low-light vision","venue":null,"work_id":"1d9dd68d-ba38-44ba-968a-8b365797d279","year":2021},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:3fadb85ea28cb65d8bea5d66545ac5beb857901fb30fe42a44050526efdb69dd","observation_id":"0ae2a3c4-5690-49d9-b3b6-153260e0064f","resolution":{"observed_at":"2026-05-18T16:32:45.317229Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tencent text-video retrieval: hierarchi- cal cross-modal interactions with multi-level representations","venue":null,"work_id":"4d85a792-6c71-44e7-8911-730916a0c46d","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:780da03fcee9f9db9035d1a1e1b11b2275fbefb767e90d799ac663bcdeceaba3","observation_id":"a47151a0-7d07-4b6b-b746-a5aa31a36cd9","resolution":{"observed_at":"2026-05-18T16:32:45.357759Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Segmenting objects in day and night: Edge-conditioned cnn for thermal image semantic segmentation.TNNLS, 32(7): 3069–3082","venue":null,"work_id":"326c165a-6546-4f2a-8a9f-df96f3ea60aa","year":2020},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:98b0700c68091473a60a9ab43034ed0664f89dbbe92476575a7ba6e2ff97cb2e","observation_id":"9849a1d1-0c09-485e-b2e2-114b3c0f1c3a","resolution":{"observed_at":"2026-05-18T16:32:45.388556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lasher: A large-scale high- diversity benchmark for rgbt tracking.TIP, 31:392–404","venue":null,"work_id":"7f7cbeda-1736-4fae-81cc-200c6ee3d455","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:50de0fe417f378d8a4276d96997f8cb445c4d6e091f8c54054788d336398d355","observation_id":"bba935d6-8cb0-4e9c-9254-918d57dc825e","resolution":{"observed_at":"2026-05-18T16:32:45.321893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Feature pyramid networks for object detection","venue":null,"work_id":"48cb6cec-033a-4924-9753-9042132beca5","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:d0700a759e66ea8cd33ce56f11e969d44943b67c9c58b376c67498b0328df53c","observation_id":"977d941b-9127-4cca-9e4b-56d854c83d9d","resolution":{"observed_at":"2026-05-18T16:32:45.377500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Infmae: A foundation model in the infrared modality","venue":null,"work_id":"cab5beea-fdbb-4954-b8e9-9d0ecc92d1b0","year":2025},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:154fcaf5d74bcf469b174de27377db3307957d5c54d4bf76c436883404e0479a","observation_id":"ecb22407-e09d-44e5-8a50-0ef0665779ea","resolution":{"observed_at":"2026-05-18T16:32:45.337725Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Target-aware dual adversarial learning and a multi-scenario multi-modality benchmark to fuse infrared and visible for object detection","venue":null,"work_id":"5d59f79c-d811-495d-92ff-9c358057b0f6","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:7a4f3131e521f99af9af8c91f5904b37e30fc0c84f38e3e63716de7584d3bc35","observation_id":"9c8f12f3-e134-4288-9aab-f4e382cf4c66","resolution":{"observed_at":"2026-05-18T16:32:45.345230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"X-clip: End-to-end multi-grained con- trastive learning for video-text retrieval","venue":null,"work_id":"eff53141-74dd-4f96-a246-85cf2605c5c1","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:a3a15fb1c46392dcc99488340111535fc7220a487611494ada627c3830cf3816","observation_id":"40059d25-3d69-4b6c-8f97-7356b393403e","resolution":{"observed_at":"2026-05-18T16:32:45.330038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Multi- level cross-modal semantic alignment network for video–text retrieval.Mathematics, 10(18):3346","venue":null,"work_id":"5b950c7b-c371-4db8-a61c-08d9c1ba0119","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:e1587bf62fb3259200a0f3456ea88bd3bdfb4f3f9542d20abb15479218b878e9","observation_id":"c14689af-6625-4c21-9dd5-2a781b3a2e02","resolution":{"observed_at":"2026-05-18T16:32:45.333648Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-11T10:12:11.384939Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:b5be7620b7d8c9d354c57a93cd5a9c3bd7caa67e7be4a6ebc44baa5f6b7f2656","observation_id":"9bd0514a-bca2-42ce-b79d-67fde6eebb96","resolution":{"observed_at":"2026-05-18T16:31:37.152875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learn- ing transferable visual models from natural language super- vision","venue":null,"work_id":"a43607d1-7ee0-470a-afe4-b040a37e2aab","year":2021},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:3a5e7396c9bf51dac1b3568d14cf76c5ee799dcf282382e2ee6017e1a10af24c","observation_id":"82c40e70-4f60-47a8-a1df-8dbb573fb9df","resolution":{"observed_at":"2026-05-18T16:31:38.588780Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Faster r-cnn: Towards real-time object detection with region proposal networks.PAMI, 39(6):1137–1149","venue":null,"work_id":"6f490797-06d8-4fa7-a197-6b33484cf28e","year":2016},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:15ad266396c534439832b1376cb26c7debe7426b66312ca21b1c63345dde9b85","observation_id":"c225f6c9-7854-4ae2-9c34-395fdcff2f90","resolution":{"observed_at":"2026-05-18T16:32:45.341435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The earth mover’s distance as a metric for image retrieval.In- ternational journal of computer vision, 40(2):99–121","venue":null,"work_id":"370d3087-ecc3-4601-b8e2-89de8e01b0c2","year":2000},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:58fc9f91926556e900f3b4424f797d50b1b806869b1c53544f3deb25a97fedf5","observation_id":"212aae39-2afd-4154-81aa-c65fd10cd165","resolution":{"observed_at":"2026-05-18T16:31:38.592078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Drone-based rgb-infrared cross-modality vehicle detection via uncertainty-aware learning.TCSVT, 32(10):6700–6713","venue":null,"work_id":"8fb1618a-2185-4fcc-87d3-588a59f46bff","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:20fdcdd6379390a5dfdad6e99b50fdf417d13bd3eb1f24a2674f1836803b0ab5","observation_id":"2bcf8726-9a65-4f41-b42a-7d74d21c2c20","resolution":{"observed_at":"2026-05-18T16:31:38.585623Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piafusion: A progressive infrared and visible im- age fusion network based on illumination aware.Information Fusion","venue":null,"work_id":"96b36422-5f24-4b39-9064-e6f53f99290f","year":2022},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:43a4238d1649d9cd088a79813693d53965370c8f4b8287725501166b46edb0ff","observation_id":"8f350059-768c-4a97-beb8-26d99a61f0e0","resolution":{"observed_at":"2026-05-18T16:31:38.595180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fine-grained action retrieval through multiple parts- of-speech embeddings","venue":null,"work_id":"6bbdb83b-ade2-47cf-a7af-94290c6bce7b","year":null},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:4f7cde1d66eebe0fa2954d0c21cd3d2d30568e950c4773d203fb2f12b4645833","observation_id":"60b6caac-a745-4695-b6ea-4b0dbbd09b16","resolution":{"observed_at":"2026-05-18T16:32:45.326472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unified perceptual parsing for scene understand- ing","venue":null,"work_id":"2c1347a6-80da-42c6-9a1a-e1b918e8fef0","year":2018},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:5d66de48bd6dd03df29c130f164fb042b2d4ca2002fb42061a68d9872f238742","observation_id":"40e74b97-18ab-4f2e-b782-b815d7afca10","resolution":{"observed_at":"2026-05-18T16:32:45.395213Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hitea: Hierarchical temporal- aware video-language pre-training","venue":null,"work_id":"3d9dbf14-4444-4bd6-b609-9a6b7fe16495","year":2023},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:aa3fd8d9a40da482a94964d8c5dad40a02002be3c63b46fca4d413e04eca332a","observation_id":"0a8b5769-fd20-45b2-a733-9da959ddd5e7","resolution":{"observed_at":"2026-05-18T16:32:45.360978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"1d9cb606-6e9a-4b37-891a-bdd0834c85e0","year":2023},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:b1509741c513ea1ec1f009bc812f49639785f921a3a974e4045c3768e04bbc55","observation_id":"36226bf4-198f-49f8-b791-891a9717c59d","resolution":{"observed_at":"2026-05-18T16:32:45.348380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.08192","last_updated":"2023-12-13T14:57:28Z","snapshot_observed_at":"2026-08-13T05:03:14.172975Z","submitted_at":"2023-12-13T14:57:28Z","title":"PAD: Self-Supervised Pre-Training with Patchwise-Scale Adapter for Infrared Images","version":1},"cited_work":{"arxiv_id":"2312.08192","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.08192","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pad: Self-supervised pre-training with patchwise-scale adapter for infrared im- ages","venue":null,"work_id":"f16e2a65-5301-4164-9179-0691cdcc78b4","year":2023},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2312.08192","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:80bfdc3f4ed68a451cc0ad6d87f2469d987d34f688cc4c6bc5f57775e8d06123","observation_id":"2f978e6a-9ae7-466f-9d25-219877188654","resolution":{"observed_at":"2026-05-18T16:31:37.157492Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02257","last_updated":"2025-03-20T13:55:08Z","snapshot_observed_at":"2026-08-13T01:38:17.387526Z","submitted_at":"2025-02-04T12:08:20Z","title":"UNIP: Rethinking Pre-trained Attention Patterns for Infrared Semantic Segmentation","version":2},"cited_work":{"arxiv_id":"2502.02257","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.02257","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unip: Rethinking pre-trained attention patterns for infrared semantic segmentation","venue":null,"work_id":"3228c784-9cc7-4f0c-84b2-1654a70527f8","year":2025},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2502.02257","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:7faf9eb20722065c65581a3ee1943df6fd6abf024c5a909642994db7f3fb69c2","observation_id":"deedfaa1-d2b8-4a73-a7ab-be4fab009306","resolution":{"observed_at":"2026-05-18T16:31:37.166147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scene parsing through ade20k dataset","venue":null,"work_id":"b96bd21c-ca6f-4e3f-81ca-9144c88c6570","year":2017},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:952ae8a6c943b2e855c63b7cffe829ac452397f7107913dda83b40e8c494aef2","observation_id":"5c14ab0c-542b-4b1d-af81-d877ec393311","resolution":{"observed_at":"2026-05-18T16:32:45.381215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07832","last_updated":"2022-01-27T09:20:49Z","snapshot_observed_at":"2026-07-06T12:08:39.149450Z","submitted_at":"2021-11-15T15:18:05Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","version":3},"cited_work":{"arxiv_id":"2111.07832","doi":"10.48550/arxiv.2111.07832","metadata_source":"pith","pith_arxiv_id":"2111.07832","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"iBOT: Image BERT Pre-Training with Online Tokenizer","venue":"cs.CV","work_id":"ddf5ecec-b36e-4d27-96b7-5aefc236d17c","year":2021},"citing_paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-18T16:28:48.494939Z"},"links":{"cited_paper":"/paper/2111.07832","citing_paper":"/paper/2509.15642"},"observation_digest":"sha256:20713a745ccceb98401902c9ac75df610a9ded89ea590ae059e143be28686a82","observation_id":"fb6eea95-5fe6-4981-b522-70b61f53c47b","resolution":{"observed_at":"2026-05-18T16:31:37.175410Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-07-11T01:49:43.656481+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T01:49:43.656481+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2509.15642","last_updated":"2026-05-13T09:44:42Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T11:33:28.649975Z","submitted_at":"2025-09-19T06:07:53Z","title":"UNIV: Unified Foundation Model for Infrared and Visible Modalities"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":9,"verified_fuzzy":35},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 1 inbound Pith citation observation for arXiv:2509.15642."}