{"as_of":"2026-08-08T11:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75baf2e24207be311e2e1c30ef3cbdcd02fcd6928e45b02ae8fa70675ddf4d2f","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:25:56.642103Z","state":"measured"},{"denominator":71,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":71,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T22:40:10.108333Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T22:44:01.449286Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2511.13415","last_updated":"2026-05-09T06:27:59Z","snapshot_observed_at":"2026-07-06T22:36:00.635873Z","submitted_at":"2025-11-17T14:28:41Z","title":"Attention Grounded Enhancement for Visual Document Retrieval","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-17T20:53:15.920563Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2511.13415"},"observation_digest":"sha256:3b7fa47e73999fae824f2445c92f420a71be570b02dbc09f161dc0544bed22d5","observation_id":"ceb08927-47a9-44d3-8dfd-84f2b575e608","resolution":{"observed_at":"2026-05-17T20:55:15.283513Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2603.25383","last_updated":"2026-04-22T09:05:30Z","snapshot_observed_at":"2026-07-06T22:50:37.468743Z","submitted_at":"2026-03-26T12:34:18Z","title":"CLIP-RD: Relative Distillation for Efficient CLIP Knowledge Distillation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T00:20:36.975106Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2603.25383"},"observation_digest":"sha256:152f900e34dd562095e25119b2ed97baf73368173f3976474f0179cffb04ffdb","observation_id":"5f077924-f68a-414c-b070-b612d00c08d5","resolution":{"observed_at":"2026-05-15T00:23:22.850024Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"cited_work":{"arxiv_id":"2505.21549","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.21549","snapshot_observed_at":"2026-06-29T22:44:01.449286Z","title":"arXiv preprint arXiv:2505.21549 (2025)","venue":null,"work_id":"4339d435-4ad2-4245-b4f1-ae058c618d9d","year":2025},"citing_paper":{"arxiv_id":"2605.25479","last_updated":"2026-05-25T06:35:33Z","snapshot_observed_at":"2026-08-01T17:57:45.021342Z","submitted_at":"2026-05-25T06:35:33Z","title":"MAIL++: Multi-Modal Bi-directional Agent Layer for Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-29T22:40:10.108333Z"},"links":{"cited_paper":"/paper/2505.21549","citing_paper":"/paper/2605.25479"},"observation_digest":"sha256:e791f8071329b727f585d75aaf757520835f5f996e6248fd68f887920a905b67","observation_id":"cf5c23bd-f9bd-449a-aa6d-c135d760bb0e","resolution":{"observed_at":"2026-06-29T22:44:01.450876Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.21549/citation-record","integrity":"/paper/2505.21549/integrity","json":"/paper/2505.21549/citation-record.json","paper":"/paper/2505.21549"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:06.235398Z","title":null,"venue":null,"work_id":"a8d6bf89-e493-4e1c-9579-1f056f0a75cd","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.618904Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:0abb065315cc3f7c43cf2f249dbe73d6e815f6eac172721f7bcf992983224002","observation_id":"77803a8b-ef8f-4d1f-af23-efba41f6513a","resolution":{"observed_at":"2026-08-07T14:26:06.306261Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:06.083399Z","title":null,"venue":null,"work_id":"ed2bf61e-6f6d-484a-a7e4-1fdd43594cd7","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.704353Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:dd5d4af86f405d4f5a7f046a21a030ab72f5fe29b03dee43ffbf5e34e84a52b2","observation_id":"5c69eb8b-a10f-4467-8f9d-99bbdd9df984","resolution":{"observed_at":"2026-08-07T14:26:06.158309Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04544","last_updated":"2025-03-25T14:34:04Z","snapshot_observed_at":"2026-08-04T10:22:52.279940Z","submitted_at":"2021-10-09T11:39:30Z","title":"CLIP-Adapter: Better Vision-Language Models with Feature Adapters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04544","snapshot_observed_at":"2026-08-07T14:25:52.768260Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.768260Z"},"links":{"cited_paper":"/paper/2110.04544","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:f3c516d0ca371f9792da4eb49614df40b681e79508d194702ad46b928a17189e","observation_id":"816bed74-d1f1-4642-bb44-4ad8b8361707","resolution":{"observed_at":"2026-08-07T14:25:52.768260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.975434Z","title":null,"venue":null,"work_id":"d87697fa-f9da-418a-85d0-f11e12b48977","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.802193Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:84b3814fbb0604d47c9ea5d5d17e9a9c8301c645a67847c538d8b9d2260503b5","observation_id":"de01a239-138b-4e74-822f-d631754fd328","resolution":{"observed_at":"2026-08-07T14:26:06.025551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03700","last_updated":"2025-01-09T09:12:06Z","snapshot_observed_at":"2026-08-04T10:20:08.342718Z","submitted_at":"2023-12-06T18:59:19Z","title":"OneLLM: One Framework to Align All Modalities with Language","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03700","snapshot_observed_at":"2026-08-07T14:25:52.851020Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.851020Z"},"links":{"cited_paper":"/paper/2312.03700","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:b8349789d346301a5a4082eaffd47d529bec84d57fdb55457c486c1881761e9b","observation_id":"800823cb-a109-4a0f-87e9-f8838e1f2a34","resolution":{"observed_at":"2026-08-07T14:25:52.851020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.03640","last_updated":"2023-03-26T11:40:16Z","snapshot_observed_at":"2026-08-07T01:42:48.593126Z","submitted_at":"2022-12-06T18:59:58Z","title":"Fine-tuned CLIP Models are Efficient Video Learners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.03640","snapshot_observed_at":"2026-08-07T14:25:52.953445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:52.953445Z"},"links":{"cited_paper":"/paper/2212.03640","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:5ed9c8a98080101475ec33b9aa4b5e7e5f694ec21a61139e1479252c9b092762","observation_id":"804f3574-872c-418b-b0e9-eceab72a7017","resolution":{"observed_at":"2026-08-07T14:25:52.953445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.835752Z","title":null,"venue":null,"work_id":"ccd80847-5aa1-4ae5-b385-bef2667c856b","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.084531Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:4f74d3da8f5b32a295b058083fae21b197e11db14139f59c5e7e18bc25b022aa","observation_id":"3450a384-c6eb-4f7a-ac1e-d8c9337fb875","resolution":{"observed_at":"2026-08-07T14:26:05.879497Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.644729Z","title":null,"venue":null,"work_id":"2d5424af-6635-4ca4-9148-e5470844def5","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.248527Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:06c07661cfca930e4cbd290a19bbde8d2e015f9fbae654bcba469ec7f51c2ca4","observation_id":"27b72cf7-f33f-4447-afe4-bc09a9de8898","resolution":{"observed_at":"2026-08-07T14:26:05.760485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.445452Z","title":null,"venue":null,"work_id":"add22c4a-6dbd-41a3-a07c-f35ddf867667","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.383904Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:bf46cf9031f644b4e1ab2d702de08581b86e5b5475651e77eb947d6337e88b46","observation_id":"f2966392-8830-4c7e-a7ff-29b3f672cff8","resolution":{"observed_at":"2026-08-07T14:26:05.554551Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:05.285545Z","title":null,"venue":null,"work_id":"623dc46b-377d-4db0-9b1e-b1c0a3591f7b","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.405358Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:a19100643eaaa8cc0ff26c0153412295ec86c4bb1ad63679eef7e573a098492e","observation_id":"46c10d89-9397-4191-a058-6bbd53ef6263","resolution":{"observed_at":"2026-08-07T14:26:05.353313Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.991836Z","title":null,"venue":null,"work_id":"b491e0d1-15e6-4119-90ab-27a7556e915d","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.432732Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:ea1e9c4b4cec6d1071c16775bf79a66f27b795bbad16d352278e2a741e2432bc","observation_id":"5f406df9-9ea2-4698-a141-5f13ad5275f0","resolution":{"observed_at":"2026-08-07T14:26:05.145186Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.742208Z","title":null,"venue":null,"work_id":"36e5a3de-884d-4c84-82b4-b3172355b653","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.468328Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6a43117af4b02e4049e6131c0986927cc453a157be536dd2a73804d1148842cf","observation_id":"e6aeb35b-de0b-4a99-8a64-13ff5de7c655","resolution":{"observed_at":"2026-08-07T14:26:04.837451Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-07T14:25:53.489390Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.489390Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:b58a719bbaa2d670ecfd47e62036d77d76ed2313033860b4d84e6974e49eb521","observation_id":"787ccc01-f743-44f5-813f-312dc182a607","resolution":{"observed_at":"2026-08-07T14:25:53.489390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09707","last_updated":"2024-04-15T12:06:00Z","snapshot_observed_at":"2026-08-04T13:38:45.190068Z","submitted_at":"2024-04-15T12:06:00Z","title":"Adaptive Patching for High-resolution Image Segmentation with Transformers","version":1},"cited_work":{"arxiv_id":"2404.09707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09707","snapshot_observed_at":"2026-08-07T14:25:57.660151Z","title":"Adaptive Patching for High-resolution Image Segmentation with Transformers","venue":"cs.CV","work_id":"4084de9b-0c43-4ba2-8250-a50461eff800","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.542586Z"},"links":{"cited_paper":"/paper/2404.09707","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:09f08f558c7567c37723bc424bb2e25f7ee715aa68d0f2fdfc974e06776789be","observation_id":"e405f21c-933b-4842-a1f0-0ed22870de11","resolution":{"observed_at":"2026-08-07T14:25:57.743944Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.469450Z","title":null,"venue":null,"work_id":"8517ce42-6094-460f-b964-2c9bcbcd0a61","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.632149Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:840adb4878901cee29d1d4a6cd1eede4670621d0ed188154698cdf37117f8027","observation_id":"a751ab19-f26d-4c53-b13f-aad7128a0eaf","resolution":{"observed_at":"2026-08-07T14:26:04.618452Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.260428Z","title":null,"venue":null,"work_id":"cf782dfc-f977-4de3-b1f0-392ee27116b8","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.672898Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:8f189f9668c35b45360fe4494ceeaf7c4e3f36630b01b0661782dec74a284775","observation_id":"297f96f3-5860-4e34-8808-6dbcca327c9c","resolution":{"observed_at":"2026-08-07T14:26:04.321137Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:04.122564Z","title":null,"venue":null,"work_id":"9b216670-212e-4976-8571-fc8fba2e047f","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.723917Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:4c0f8d543816faab0c7b90a4d2023d279e1af8b080b9aefa670072431d8565cd","observation_id":"780ba6ee-7f08-4364-b80c-d7e3d43f92be","resolution":{"observed_at":"2026-08-07T14:26:04.198900Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.959862Z","title":null,"venue":null,"work_id":"1853f4ea-8e5c-46ad-a101-6e6c1e9ff6d2","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.758721Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:096bffbc2aff33a9d20a520a018c510d96f180c42ac96c2700451af3078d41a8","observation_id":"6832ad51-1f35-4c4d-86c4-92a27ac9efb8","resolution":{"observed_at":"2026-08-07T14:26:04.057432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.721645Z","title":null,"venue":null,"work_id":"1cbed41e-3450-4b65-a1ca-a19039c3fea8","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.914668Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:a702cb3518fa4010b7a2585f208efcc4b93240a874e08847eda06d32be49e573","observation_id":"f7e3fe60-a62c-4576-a329-6aaae5b529a7","resolution":{"observed_at":"2026-08-07T14:26:03.835529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.469489Z","title":null,"venue":null,"work_id":"faad5475-1cea-4bf3-9372-3fa6a936df51","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:53.958792Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:c41a28dd998d371880a7894639abc8549e706c44ab7cfa5b113e8a8bb9ff5c04","observation_id":"430b1839-d9e6-4bbe-bf4a-89e8ef83464b","resolution":{"observed_at":"2026-08-07T14:26:03.577939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.265944Z","title":null,"venue":null,"work_id":"1a89c6f2-510b-4652-b39b-25e49d11822b","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.028691Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:1684ce5e6c3a2aa5d4c247095b7009f7952638c0f2bd431e74fbf61d513e5243","observation_id":"45862c8c-ebf5-43cd-a029-9407abf21db4","resolution":{"observed_at":"2026-08-07T14:26:03.368362Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:03.051936Z","title":null,"venue":null,"work_id":"b40118c4-7f37-4d07-9792-5c09dbac5926","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.085809Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:70b86780ad4beb60c8c64e0766c7a59af2c83b377d64220ad6971122ac694884","observation_id":"8ca12903-9f93-412f-8dbd-fa962f3b6807","resolution":{"observed_at":"2026-08-07T14:26:03.184792Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.841666Z","title":null,"venue":null,"work_id":"5062db41-1e9b-40a3-8a41-2110a56fbc93","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.174626Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:113933ac5614fefa8f5319c48439f827f713a964726d9fdf03f436356c1ea0bd","observation_id":"937a579d-9daf-45f4-9340-f349e0ef23f4","resolution":{"observed_at":"2026-08-07T14:26:02.959638Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2008.11191","last_updated":"2020-08-25T17:49:25Z","snapshot_observed_at":"2026-07-06T09:50:06.310950Z","submitted_at":"2020-08-25T17:49:25Z","title":"Multi-team Formation using Community Based Approach in Real-World Networks","version":1},"cited_work":{"arxiv_id":"2008.11191","doi":null,"metadata_source":"pith","pith_arxiv_id":"2008.11191","snapshot_observed_at":"2026-08-07T14:25:57.497151Z","title":"Multi-team Formation using Community Based Approach in Real-World Networks","venue":"cs.SI","work_id":"6af3e722-de74-4e6b-99ee-f26a36d4ea0e","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.233395Z"},"links":{"cited_paper":"/paper/2008.11191","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:5a516680821b30f688635dd739bd1dcea440c7c4dc6d3dbb44877982e4a98aef","observation_id":"45c7df7a-63dd-4d3a-9a20-652cccfc4121","resolution":{"observed_at":"2026-08-07T14:25:57.521180Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-07T14:25:54.298722Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.298722Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:0db89e31e4dcca37bd9705346b0ffcc467081f2ea3fcfaf3c447275aaa711226","observation_id":"eb1aa8f0-fb6c-4214-8121-e28883717cc4","resolution":{"observed_at":"2026-08-07T14:25:54.298722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.607197Z","title":null,"venue":null,"work_id":"ed18c321-623f-4c52-981d-6e500a4e07d6","year":2014},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.325371Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:4d6ff4a594828b7c0980cfdb846b71b9398b303724bd023ae415c7b39dcc539a","observation_id":"510f9c60-9be4-45fd-aa53-af17b0f65c59","resolution":{"observed_at":"2026-08-07T14:26:02.702185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.304803Z","title":null,"venue":null,"work_id":"1fad46b6-17cc-4feb-ae4f-6ce0f6f49bdb","year":2014},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.370149Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:f7ea0653efd338c9e86489d77b18ad0c75d607783cd7f0468bd76fbd7ba915fa","observation_id":"7bb10e6d-c9f9-4927-8207-92e511537aef","resolution":{"observed_at":"2026-08-07T14:26:02.447544Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:02.028313Z","title":null,"venue":null,"work_id":"08729d95-de6d-48cb-b7fe-af228a81295b","year":2018},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.423431Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:a3057a1a4c908f4ddce87e0bc9aebb3ef899c6e43330220e3c0c7f1a8a853b02","observation_id":"473c556d-5c5e-435c-92b4-74be9aa21ec8","resolution":{"observed_at":"2026-08-07T14:26:02.195716Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:01.776158Z","title":null,"venue":null,"work_id":"a31a6f4e-b8e6-41c7-aad9-71ba01a6405b","year":2009},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.465184Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:ec2c05b0c3668338a6adadcfd79525e3dab8485afa3e3398e67243204b6aeb08","observation_id":"24da164b-25da-4761-ba47-1a64075ea759","resolution":{"observed_at":"2026-08-07T14:26:01.874221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:01.481204Z","title":null,"venue":null,"work_id":"7a59931b-d6f3-43d1-925f-ed5277e6fd0b","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.491297Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:af839c386e156b61462541acd6e5c04b5b129aec04d4c9f490077b039c1c95fb","observation_id":"b8936649-867c-4878-a8f2-87ffe8c7787e","resolution":{"observed_at":"2026-08-07T14:26:01.628646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20204","last_updated":"2024-06-26T12:31:48Z","snapshot_observed_at":"2026-07-06T18:22:48.671656Z","submitted_at":"2024-05-30T16:07:54Z","title":"Jina CLIP: Your CLIP Model Is Also Your Text Retriever","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20204","snapshot_observed_at":"2026-08-07T14:25:54.587472Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.587472Z"},"links":{"cited_paper":"/paper/2405.20204","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7488698f1fda525b0b91ed313fcf7cd27572aa24dceddcd97384ed6f6ed13970","observation_id":"27933465-9277-4982-a242-568cca4b7967","resolution":{"observed_at":"2026-08-07T14:25:54.587472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.07056","last_updated":"2024-01-13T12:09:49Z","snapshot_observed_at":"2026-07-06T17:15:10.548959Z","submitted_at":"2024-01-13T12:09:49Z","title":"Aquarium: A Comprehensive Framework for Exploring Predator-Prey Dynamics through Multi-Agent Reinforcement Learning Algorithms","version":1},"cited_work":{"arxiv_id":"2401.07056","doi":null,"metadata_source":"pith","pith_arxiv_id":"2401.07056","snapshot_observed_at":"2026-08-07T14:25:57.274126Z","title":"Aquarium: A Comprehensive Framework for Exploring Predator-Prey Dynamics through Multi-Agent Reinforcement Learning Algorithms","venue":"cs.AI","work_id":"38675ab7-9fe3-4f5a-9b33-f40c0bc4251d","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.682011Z"},"links":{"cited_paper":"/paper/2401.07056","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:fd6dc2fc4616c4e33872d6caf84c723742664437a1992177de446f6dec1669f1","observation_id":"772ed903-528e-47c5-88e2-123ce7e7f784","resolution":{"observed_at":"2026-08-07T14:25:57.380211Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:01.194634Z","title":"I., Farajtabar, M., Li, A., Ghasemzadeh, H., & Saupe, D","venue":null,"work_id":"64f78386-98b9-407b-8682-bbb61c869472","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.709598Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:a13290f41ad82fc5e7e990d232fe9c0b9043778bb6c2ac025cabe16f7b6ee7a4","observation_id":"3284e3cd-8b45-497f-9ca3-f5a28bfcd801","resolution":{"observed_at":"2026-08-07T14:26:01.308384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.979960Z","title":null,"venue":null,"work_id":"b317ed1e-02c6-4651-9fec-e7d968fbb4a9","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.741486Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:46a631b6694c5717b0cb49bc7fce3700f8fc02f561c56a0e0ca1ebb3625e8cfe","observation_id":"c379f565-2024-4d5c-8283-b3997f88299c","resolution":{"observed_at":"2026-08-07T14:26:01.100534Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.864612Z","title":null,"venue":null,"work_id":"56d15657-0690-4b92-b1bd-fdec31110e24","year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.773044Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:c80c2665dd52587c681c46fcd71a50d4ce9b3d213a21214da0037fc33ad43fd7","observation_id":"92cc46db-3479-43b1-912e-35fc68e44134","resolution":{"observed_at":"2026-08-07T14:26:00.955376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.741582Z","title":null,"venue":null,"work_id":"1cace2af-d690-40d4-b45f-4fb3665a40d9","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.809222Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:46fae92817018db6cd8914761d5c4bebef933751671496af01b05867ebc1d40f","observation_id":"e7cf84d4-ce30-488a-a60e-5073405202ce","resolution":{"observed_at":"2026-08-07T14:26:00.798250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.565308Z","title":null,"venue":null,"work_id":"da223fcd-b503-40bc-9070-589bdf393400","year":2015},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.873672Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d1a4a8c327bd9901d61f1fa42c052ca9f38a29ac523e807b5b9e1d9a4114e69c","observation_id":"18818753-9188-4a5b-814d-60688f1f14fd","resolution":{"observed_at":"2026-08-07T14:26:00.645022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.02441","last_updated":"2022-07-06T05:12:59Z","snapshot_observed_at":"2026-08-06T08:58:06.703120Z","submitted_at":"2022-07-06T05:12:59Z","title":"Inverse problems of inhomogeneous fracture toughness using phase-field models","version":1},"cited_work":{"arxiv_id":"2207.02441","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.02441","snapshot_observed_at":"2026-08-07T14:25:57.186672Z","title":"Inverse problems of inhomogeneous fracture toughness using phase-field models","venue":"math.AP","work_id":"fda3b222-12a3-4776-9d59-5f8fc2d1f549","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:54.964767Z"},"links":{"cited_paper":"/paper/2207.02441","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:b1ca30adecd32d958bcb9a0d3002e915cfe8e6c2c9ca72414bd544154c76d565","observation_id":"fa0d8260-2ae5-4961-b396-9158165906aa","resolution":{"observed_at":"2026-08-07T14:25:57.213726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.08793","last_updated":"2022-10-07T18:23:44Z","snapshot_observed_at":"2026-08-05T17:14:45.225349Z","submitted_at":"2021-12-16T11:22:30Z","title":"Fire retainment on Cayley graphs","version":2},"cited_work":{"arxiv_id":"2112.08793","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.08793","snapshot_observed_at":"2026-08-07T14:25:57.064528Z","title":"Fire retainment on Cayley graphs","venue":"math.GR","work_id":"47c44c5d-11cd-49ed-ad0d-f4c453d369eb","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.009028Z"},"links":{"cited_paper":"/paper/2112.08793","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:31abfacbc166f6b0ddef0b29d3bb8002aebc9d3e59807ad08758f6caa3082c2b","observation_id":"0f039e56-3c63-4c6c-8de0-54842830672f","resolution":{"observed_at":"2026-08-07T14:25:57.120676Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.00580","last_updated":"2023-03-01T15:23:13Z","snapshot_observed_at":"2026-07-06T14:57:24.801417Z","submitted_at":"2023-03-01T15:23:13Z","title":"The propagation game: on simulatability, correlation matrices, and probing security","version":1},"cited_work":{"arxiv_id":"2303.00580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.00580","snapshot_observed_at":"2026-08-07T14:25:56.929228Z","title":"The propagation game: on simulatability, correlation matrices, and probing security","venue":"cs.CR","work_id":"1409ed0d-537e-4988-a414-319945881812","year":2023},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.046151Z"},"links":{"cited_paper":"/paper/2303.00580","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7ea1588a6a0ddc817ae6e476f06a6719f1e1a04eeb9c3c896d23c4b3832bee90","observation_id":"369746f0-1255-4db0-93d5-9dd4e3437620","resolution":{"observed_at":"2026-08-07T14:25:57.017691Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.399834Z","title":null,"venue":null,"work_id":"31d8a87b-6e24-49b4-a780-f710407e3c73","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.096875Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d26f094869f00058d7a85eddb0cb054328f15df790f464096c2636201adec6d1","observation_id":"951e1b19-936d-473a-bdb9-cfa205f72b9c","resolution":{"observed_at":"2026-08-07T14:26:00.472396Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:55.187622Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.187622Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:63fa5727e8af623bf3fcccfd8e2e8e6c3fc8a0a19a6f7f510486e4f0ff5c2009","observation_id":"fa746d19-9f32-4c77-9191-cdadcd3c32ae","resolution":{"observed_at":"2026-08-07T14:25:55.187622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02961","last_updated":"2019-10-07T18:00:02Z","snapshot_observed_at":"2026-07-06T08:27:30.833961Z","submitted_at":"2019-10-07T18:00:02Z","title":"Dirac neutrinos from Peccei-Quinn symmetry: a fresh look at the axion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02961","snapshot_observed_at":"2026-08-07T14:25:55.247256Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.247256Z"},"links":{"cited_paper":"/paper/1910.02961","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:242808b02d095009b0bf1face6f2c7b891a13c299f3f49f23ba773ab602a3ea2","observation_id":"796ca627-d06b-412b-af77-88b9b504e2dc","resolution":{"observed_at":"2026-08-07T14:25:55.247256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-07T14:25:55.276080Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.276080Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:7b172374a33b35eee20fdc086fd50094e2821939706159b60cc69d95e6ec1115","observation_id":"c5ea83e8-85f5-4a42-b2c0-d95597919937","resolution":{"observed_at":"2026-08-07T14:25:55.276080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-07T14:25:55.317226Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.317226Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d239e8c94ecf0fc2f287beed8fa8d017587bc0db0d6411d3cb0ae57f77ec8b28","observation_id":"2649876b-31ca-43a2-8910-23f665024a1d","resolution":{"observed_at":"2026-08-07T14:25:55.317226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15378","last_updated":"2024-07-22T06:10:41Z","snapshot_observed_at":"2026-08-08T00:30:36.324986Z","submitted_at":"2024-03-22T17:58:16Z","title":"Long-CLIP: Unlocking the Long-Text Capability of CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15378","snapshot_observed_at":"2026-08-07T14:25:55.385363Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.385363Z"},"links":{"cited_paper":"/paper/2403.15378","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:45eb7b4ebdb50fe5f4799b6387655d6bf6b7a501113e61bb787a377c558306b1","observation_id":"1d6f4e5d-57fc-41b3-9b1f-fd9d40e586a1","resolution":{"observed_at":"2026-08-07T14:25:55.385363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.10034","last_updated":"2025-03-28T16:47:25Z","snapshot_observed_at":"2026-07-06T19:32:42.378146Z","submitted_at":"2024-10-13T22:34:15Z","title":"TULIP: Token-length Upgraded CLIP","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.10034","snapshot_observed_at":"2026-08-07T14:25:55.508904Z","title":"M., Asano, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.508904Z"},"links":{"cited_paper":"/paper/2410.10034","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:93774f23bf12e7639506d100508cb63800f23462a879b482b870c4dab7d83895","observation_id":"c024c5c0-6a4c-490e-b3b7-6111f159227b","resolution":{"observed_at":"2026-08-07T14:25:55.508904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.199445Z","title":null,"venue":null,"work_id":"0d327f06-30d7-471d-b398-6f400cb4a1f7","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.560581Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:f9cd2250cbb3efa9832d8154ee943e5bfca392041ea5a2f1386d086f3325bb12","observation_id":"8ca5ce2b-3039-483b-ad33-7bc84798c5c8","resolution":{"observed_at":"2026-08-07T14:26:00.305470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:26:00.112185Z","title":null,"venue":null,"work_id":"f238d0e3-aae7-4572-bfcc-e362eebbf4ac","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.594642Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:ea3cf0b260a23c61efcfdc6a54eb7bc91f276719245fefe091d0df8e339ffd2a","observation_id":"a32bfb97-4d4d-48bb-840c-acb18ae9b3b4","resolution":{"observed_at":"2026-08-07T14:26:00.160018Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.934246Z","title":null,"venue":null,"work_id":"5a427145-8cb7-43d2-9f42-22aeba019907","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.641395Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:8903344b3ab162567200c3e65129643fba56dbbf5b6bd4920b0f25a3c03c1d7f","observation_id":"c4a5c5ae-1e1f-4a70-88e7-da66cf146705","resolution":{"observed_at":"2026-08-07T14:25:59.976747Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.827623Z","title":null,"venue":null,"work_id":"1026c707-70d4-4a1d-9120-4950fbeb2f5b","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.703274Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:347b34461262c264f450e3524b66ee04329ff36db4cf2443b03447b94c9aaa55","observation_id":"0ad57ba7-e140-419b-8f3a-8d22bcb1b7be","resolution":{"observed_at":"2026-08-07T14:25:59.867491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.661854Z","title":null,"venue":null,"work_id":"7288082f-046a-4264-ae59-30adb24dda11","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.779961Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:701870b9e656bd48c9dacc4f9fa181883cd93acffd790b032581e0e9f466ae2d","observation_id":"d5113bba-6c8e-42fe-b7b5-7126996b52a7","resolution":{"observed_at":"2026-08-07T14:25:59.743265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.591768Z","title":null,"venue":null,"work_id":"21a14741-1a8d-4b79-811e-f356978d2915","year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.834318Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:6dedb15fb487a2262541a3f22f8bbd24b7754cb202834e0ad25e855930235466","observation_id":"45b9e9f4-6aee-47f0-938b-84caf55dc84f","resolution":{"observed_at":"2026-08-07T14:25:59.617766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.462721Z","title":null,"venue":null,"work_id":"81397b3b-4e2e-444a-85e2-57248fb7c916","year":2020},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.866715Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:9f203f37791e978a1997313e182c445a3608826e6dc87dc63567021514ad68d4","observation_id":"fd9be4a2-9753-407b-a8fe-397e1029d094","resolution":{"observed_at":"2026-08-07T14:25:59.556469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.259924Z","title":null,"venue":null,"work_id":"ea035152-02b2-4b49-a1ad-cec30b312a1f","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.907962Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:5e2c3910452fccc80c906195ba0fe7ade0762e1927a7694437b779e90434f767","observation_id":"4f5f9f75-a98c-4737-b292-233addcaaeef","resolution":{"observed_at":"2026-08-07T14:25:59.364814Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:59.072951Z","title":null,"venue":null,"work_id":"5d49b9ec-00b2-48ae-9d8f-f0073bbb4078","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:55.944257Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:89c46eee11c616db79fd0f748328b36bb65667ae06b0d969ece4ad9508691ee4","observation_id":"ed21fad7-5d91-4b3c-9417-3d209abfc1ed","resolution":{"observed_at":"2026-08-07T14:25:59.172501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.859149Z","title":null,"venue":null,"work_id":"b19c8466-0591-45a9-86cb-43f57e797c91","year":2017},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.036282Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:606e0e126d7c081ee1807084456c81c00b295451884a2e070e5717e692597b5a","observation_id":"ddebddf3-48a2-4d59-b788-4cdcee724851","resolution":{"observed_at":"2026-08-07T14:25:58.982712Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T14:25:56.107134Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.107134Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:00086be57350c7bbb9f0abadd0364ae19c3f10e64617353c5d5e814e9be06d93","observation_id":"3809dd26-f25e-414e-8dcd-c805691c7f70","resolution":{"observed_at":"2026-08-07T14:25:56.107134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6550","last_updated":"2015-03-27T11:52:28Z","snapshot_observed_at":"2026-07-06T04:04:16.777653Z","submitted_at":"2014-12-19T22:40:51Z","title":"FitNets: Hints for Thin Deep Nets","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6550","snapshot_observed_at":"2026-08-07T14:25:56.146818Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.146818Z"},"links":{"cited_paper":"/paper/1412.6550","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:41ba298ee2c439f79f1d68fc45c03fef416583331fbfe80944329eee3296150f","observation_id":"ec7984ff-0631-4bf1-9399-aca8e26b54e0","resolution":{"observed_at":"2026-08-07T14:25:56.146818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1612.03928","last_updated":"2017-02-12T22:05:47Z","snapshot_observed_at":"2026-07-06T05:22:25.273447Z","submitted_at":"2016-12-12T21:15:57Z","title":"Paying More Attention to Attention: Improving the Performance of Convolutional Neural Networks via Attention Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1612.03928","snapshot_observed_at":"2026-08-07T14:25:56.179594Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.179594Z"},"links":{"cited_paper":"/paper/1612.03928","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:2b1297cfe9700f23335b6e7f6b39dc38b858a8f797e3514416bb8624aa629e8c","observation_id":"a88c3f50-dfb1-4b88-a0eb-4f4e29fed2d6","resolution":{"observed_at":"2026-08-07T14:25:56.179594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.691671Z","title":null,"venue":null,"work_id":"1c2ba1e1-9f43-4e2b-be16-63b952fa929d","year":2019},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.230619Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:d2fe43629f4887c67b78f7c7de004b060f83503fa593b541b726333be82f4676","observation_id":"be991ec4-1862-4158-9155-5f680d255b89","resolution":{"observed_at":"2026-08-07T14:25:58.784385Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.09648","last_updated":"2022-09-08T15:28:57Z","snapshot_observed_at":"2026-08-07T18:19:41.867805Z","submitted_at":"2022-07-20T04:39:29Z","title":"Roadmap Towards Responsible AI in Crisis Resilience Management","version":2},"cited_work":{"arxiv_id":"2207.09648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2207.09648","snapshot_observed_at":"2026-08-07T14:25:56.775027Z","title":"Roadmap Towards Responsible AI in Crisis Resilience Management","venue":"cs.SI","work_id":"33706872-501d-4d4e-adef-28ab818d3f29","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.284928Z"},"links":{"cited_paper":"/paper/2207.09648","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:4c3a10ee7ec46d376d5f1ffdcfde092ee42574878400445d2ac51aea2b30352c","observation_id":"d5140f29-4065-4f5f-9b2e-ed6c2893ec2e","resolution":{"observed_at":"2026-08-07T14:25:56.816008Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.518137Z","title":null,"venue":null,"work_id":"632eed9c-6857-4cc6-91a7-b33fef7aba51","year":2018},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.318070Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:157d763cea5915245be1a9c9aa8b5abcb40252cfc770a9785d80a7a256d526fe","observation_id":"ab60e996-028c-44cf-ab72-66aedd11b8fb","resolution":{"observed_at":"2026-08-07T14:25:58.613646Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.324347Z","title":null,"venue":null,"work_id":"1ef10e19-412e-4375-8f6b-fa569c99605a","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.376642Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:0078f5b362659915e76d423c99433644ac8a0deee17d3a64ed68d7e440db692d","observation_id":"e35d8da2-388b-4c94-9764-addf6c1fd91e","resolution":{"observed_at":"2026-08-07T14:25:58.417932Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.192585Z","title":"S., Wang, X., and Wang, J","venue":null,"work_id":"55f84b39-7977-4269-8889-52cdd2541b99","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.455900Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:904a7d6879021883ea9b8150d4a5b465313623eaf288d326b0afbcf027cb3b6e","observation_id":"4edf188e-5c01-4c3f-8401-b777df827e2e","resolution":{"observed_at":"2026-08-07T14:25:58.268350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:58.002610Z","title":null,"venue":null,"work_id":"d419e429-d223-4630-a6bf-62adf5e07c96","year":2022},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.537980Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:67bf59c11382b1f0475a6127b27d2f555635be02b02d68d6c0eda140d8ea87d5","observation_id":"75bead6e-2c1d-445a-bc90-81bc1b16de70","resolution":{"observed_at":"2026-08-07T14:25:58.060358Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:25:57.896593Z","title":null,"venue":null,"work_id":"caffb164-e555-4f4b-b99d-42e0d7e1fbe1","year":2015},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.596132Z"},"links":{"citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:bb67397154612c269fb021c573ecf3644088a6e085565b6eb60c9abe129929ea","observation_id":"2d164aa9-795e-4bb7-b884-e307c41e87c4","resolution":{"observed_at":"2026-08-07T14:25:57.949014Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-07T14:25:56.642103Z","title":"simple cosine distillation preservation loss between the student’s image embeddings and the original CLIP ViT-L model’s image embeddings","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation","version":4},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T14:25:56.642103Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2505.21549"},"observation_digest":"sha256:48cb5fc4787bff24314632237a2bcfeefb559a4185be28015f0412fa78128582","observation_id":"23f211f9-cc7c-4d95-bfbd-cde7ba2ecff2","resolution":{"observed_at":"2026-08-07T14:25:56.642103Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.21549","last_updated":"2025-06-16T01:45:22Z","latest_version":4,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T00:31:09.890078Z","submitted_at":"2025-05-25T07:08:07Z","title":"Distill CLIP (DCLIP): Enhancing Image-Text Retrieval via Cross-Modal Transformer Distillation"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":58,"verified_exact":7,"verified_fuzzy":2},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 3 inbound Pith citation observations for arXiv:2505.21549."}