{"as_of":"2026-08-09T03:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a47cc0dfb5066227225c6966442414ec3b505e19a36341c3f64a65c3ce2b5f29","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":20,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":20,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":20,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":20,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:56:16.603472Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-17T00:36:53.284895Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T16:55:57.612364Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2204.06125"},"observation_digest":"sha256:66d5566fe215bd42be430414015d5e2a571ffc5382860adb5d6eeb74f12b8bd7","observation_id":"06c965ac-515d-47b0-8d86-5a13fd5e9f36","resolution":{"observed_at":"2026-05-10T16:55:57.884737Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-15T10:53:08.292063Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2205.01917"},"observation_digest":"sha256:c8720c7b75ec7a9ff8955f284cc6c1f00edc04b237ab34c6f6ba63837a497137","observation_id":"63e1a544-2b76-4f2d-8f94-10bb981776a0","resolution":{"observed_at":"2026-05-15T10:53:08.501105Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2205.14100","last_updated":"2022-12-15T19:21:35Z","snapshot_observed_at":"2026-08-04T09:31:34.784365Z","submitted_at":"2022-05-27T17:03:38Z","title":"GIT: A Generative Image-to-text Transformer for Vision and Language","version":5},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T20:54:07.572136Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2205.14100"},"observation_digest":"sha256:806cd42149056d51b2744bda53c88d7d07a0ef37062de11cc3bc9595da7f3d74","observation_id":"257b8609-2703-419d-bd7f-42cc87b29625","resolution":{"observed_at":"2026-05-16T20:54:07.701830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-13T14:22:16.968028Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2210.08402"},"observation_digest":"sha256:8250e061f236dfa271afc2fdcf0145ee0cd23c9942449fc0478c621e2d4387eb","observation_id":"13ebeee1-ad8b-49bf-9ba1-1854afecb28b","resolution":{"observed_at":"2026-05-13T14:22:17.404806Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2212.03191","last_updated":"2022-12-07T12:20:55Z","snapshot_observed_at":"2026-07-06T14:27:34.639236Z","submitted_at":"2022-12-06T18:09:49Z","title":"InternVideo: General Video Foundation Models via Generative and Discriminative Learning","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-17T00:36:53.235740Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2212.03191"},"observation_digest":"sha256:55c0198851798e67373f7b5700489a2f3ded12f9c68d5d5aa68be5a02e2edc25","observation_id":"cb05c3d7-b7f6-4b6a-aace-20d7ebb73939","resolution":{"observed_at":"2026-05-17T00:36:53.287756Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:b14c4328df7e5734bf39e7e4c37eb66091d41957e4af248e8f49129d64d0a350","observation_id":"7825d19f-eb53-4f0d-bfd3-6f58d4a5bcf9","resolution":{"observed_at":"2026-05-13T23:30:00.616454Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:815410471280c3b1ab8f4e49a99d712d3480a22f0b7c272fa871f2de2337c5ba","observation_id":"c46e81a1-d775-4997-a9d0-c1b7f6d1e4f4","resolution":{"observed_at":"2026-05-15T06:30:22.567453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2401.01614","last_updated":"2024-03-12T23:14:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-03T08:33:09Z","title":"GPT-4V(ision) is a Generalist Web Agent, if Grounded","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-15T19:40:13.816153Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2401.01614"},"observation_digest":"sha256:09b5d81f0a63a04192a69308c5926ab03058d0a9eb6116499d998ac749b15277","observation_id":"7c908abb-08bd-4fef-9f0e-19a196ab2a6e","resolution":{"observed_at":"2026-05-15T19:40:13.975612Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-07T15:21:57.738692Z","title":"How much can clip benefit vision-and-language tasks?arXiv preprint arXiv:2107.06383, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.15401","last_updated":"2025-05-21T11:42:47Z","snapshot_observed_at":"2026-08-07T22:46:26.750692Z","submitted_at":"2025-05-21T11:42:47Z","title":"Visual Question Answering on Multiple Remote Sensing Image Modalities","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T15:21:57.738692Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2505.15401"},"observation_digest":"sha256:fd4334f34f4c2fc38f0d20f76c46b5ca795a177445b55edeea971baa2e95c15a","observation_id":"7f51676e-46bc-46ab-a39e-c9b364ed7332","resolution":{"observed_at":"2026-08-07T15:21:57.738692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-07T12:06:27.824016Z","title":"H., Tan, H., Bansal, M., Rohrbach, A., Chang, K","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03191","last_updated":"2025-05-31T11:02:24Z","snapshot_observed_at":"2026-08-08T02:50:50.296059Z","submitted_at":"2025-05-31T11:02:24Z","title":"Multimodal Generative AI with Autoregressive LLMs for Human Motion Understanding and Generation: A Way Forward","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T12:06:27.824016Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2506.03191"},"observation_digest":"sha256:86cbc23c5c7e3dd5373204186e24fba0a39b0bd0dd43e5272d34185c5ffe9568","observation_id":"30a20d7a-f05e-4890-8a86-9b15808cf933","resolution":{"observed_at":"2026-08-07T12:06:27.824016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-06T17:47:23.698001Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.10015","last_updated":"2025-07-17T11:10:58Z","snapshot_observed_at":"2026-08-09T01:12:51.382558Z","submitted_at":"2025-07-14T07:51:01Z","title":"(Almost) Free Modality Stitching of Foundation Models","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-06T17:47:23.698001Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2507.10015"},"observation_digest":"sha256:fa1fb9a51bebe26f8fae055f5260b1f7d12d8b82a533751cc68431521523d646","observation_id":"755b5c06-7c0f-48b4-8ccb-8c29caa83c8e","resolution":{"observed_at":"2026-08-06T17:47:23.698001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-06T14:52:30.367048Z","title":"How much can clip benefit vision-and-language tasks?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.17795","last_updated":"2025-07-23T14:01:16Z","snapshot_observed_at":"2026-08-07T22:30:34.067188Z","submitted_at":"2025-07-23T14:01:16Z","title":"LSDM: LLM-Enhanced Spatio-temporal Diffusion Model for Service-Level Mobile Traffic Prediction","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T14:52:30.367048Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2507.17795"},"observation_digest":"sha256:04a9b7f994f50bfb975e1612e023cfcf6427465762153287fc1d2076b6ec952d","observation_id":"2ed88d33-cd88-4c23-a33b-68593143e07b","resolution":{"observed_at":"2026-08-06T14:52:30.367048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2601.09746","last_updated":"2026-01-11T20:36:47Z","snapshot_observed_at":"2026-08-09T00:07:01.447972Z","submitted_at":"2026-01-11T20:36:47Z","title":"Multi-Agent Cooperative Learning for Robust Vision-Language Alignment under OOD Concepts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T15:22:35.204623Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2601.09746"},"observation_digest":"sha256:70fd630eaa5522c97c136d06fcf206daeae4d294b24a7892adcac405f022e9b1","observation_id":"9cb8275f-7210-4586-be21-74a5ec661e98","resolution":{"observed_at":"2026-05-16T15:23:01.929185Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-03T06:46:15.177735Z","title":"How Much Can CLIP Benefit Vision-And- Language Tasks?","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2601.22202","last_updated":"2026-05-29T13:55:04Z","snapshot_observed_at":"2026-08-04T10:30:11.662702Z","submitted_at":"2026-01-29T17:19:46Z","title":"A Survey on Semantic Communication for Vision: Categories, Frameworks, Enabling Techniques, and Applications","version":2},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:15.177735Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2601.22202"},"observation_digest":"sha256:c40cbf29db89ea3f510d70755fef3bdfd2a8ccd6806896afcd39df32566e7252","observation_id":"a78330c6-8c21-4bbd-967d-f7cc685ce06c","resolution":{"observed_at":"2026-08-03T06:46:15.177735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-02T21:46:44.409774Z","title":"How much can clip benefit vision-and-language tasks?arXiv preprint arXiv:2107.06383, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2602.19149","last_updated":"2026-07-25T04:40:07Z","snapshot_observed_at":"2026-08-08T05:16:44.664773Z","submitted_at":"2026-02-22T12:30:01Z","title":"ReVision : A Post-Hoc, Vision-Based Technique for Replacing Unacceptable Concepts in Image Generation Pipeline","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T21:46:44.409774Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2602.19149"},"observation_digest":"sha256:386a78fc3dd8af863c103f04a37e5e279046791bea9ba51e10e70eaedc480392","observation_id":"40fb61f7-08b2-490e-be4c-f1f62cb27ab2","resolution":{"observed_at":"2026-08-02T21:46:44.409774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2604.05809","last_updated":"2026-04-07T12:46:23Z","snapshot_observed_at":"2026-07-06T22:54:26.231593Z","submitted_at":"2026-04-07T12:46:23Z","title":"Stealthy and Adjustable Text-Guided Backdoor Attacks on Multimodal Pretrained Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-10T20:01:57.909924Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2604.05809"},"observation_digest":"sha256:461a59ab69f4d4da882010ddaee168798e36d7d5447bd8c77430c056185363af","observation_id":"5663d9a4-57a4-438f-9d8d-96596ad24329","resolution":{"observed_at":"2026-05-10T22:15:51.382771Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2604.09088","last_updated":"2026-04-10T08:16:59Z","snapshot_observed_at":"2026-08-02T06:22:24.141766Z","submitted_at":"2026-04-10T08:16:59Z","title":"Memory-Efficient Transfer Learning with Fading Side Networks via Masked Dual Path Distillation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-05-10T16:45:36.306400Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2604.09088"},"observation_digest":"sha256:2d255d71df53c88bb7d96a4a09b08007e0fca9616bdb2901700d7bfd6881bf09","observation_id":"c5b00289-6703-4814-b945-2178383806fe","resolution":{"observed_at":"2026-05-11T08:15:58.886998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2604.17472","last_updated":"2026-04-19T14:53:38Z","snapshot_observed_at":"2026-07-06T23:04:32.734175Z","submitted_at":"2026-04-19T14:53:38Z","title":"UniMesh: Unifying 3D Mesh Understanding and Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-10T06:55:42.679323Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2604.17472"},"observation_digest":"sha256:38bafebf6f59c951a7909a480e1f869038fdc7010b38ed6c1655f6e275e1bae4","observation_id":"3be7cf25-66f4-452c-ad79-910c97532f0b","resolution":{"observed_at":"2026-05-10T06:56:47.284701Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":"2107.06383","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How much can clip beneﬁt vision-and-language tasks?","venue":null,"work_id":"3b4c7819-6f34-4c2d-91df-038dc5d7c576","year":2021},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:21ead0949ae393af49507030ae5b793dbf054c4cd165f12adfb946e9f7ee2a13","observation_id":"f8bb81e6-b1e9-46d1-9b9b-5215e824a818","resolution":{"observed_at":"2026-05-11T07:01:12.086179Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.06383","snapshot_observed_at":"2026-08-08T00:56:16.603472Z","title":"How much can clip benefit vision-and-language tasks?arXiv preprint arXiv:2107.06383, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.03109","last_updated":"2026-08-04T04:30:04Z","snapshot_observed_at":"2026-08-08T00:50:29.592902Z","submitted_at":"2026-08-04T04:30:04Z","title":"Multimodal Plant Root Phenotyping with Integration of 3D Skeleton Extraction and Language Analysis","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T00:56:16.603472Z"},"links":{"cited_paper":"/paper/2107.06383","citing_paper":"/paper/2608.03109"},"observation_digest":"sha256:73b140e83c78ac7b30abc69ecaa4f385022d7a08391c31b9cd53952855c1f57d","observation_id":"808ed0c4-435b-46a9-a0b0-dbec6a5eae76","resolution":{"observed_at":"2026-08-08T00:56:16.603472Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2107.06383/citation-record","integrity":"/paper/2107.06383/integrity","json":"/paper/2107.06383/citation-record.json","paper":"/paper/2107.06383"},"outbound":[],"paper":{"arxiv_id":"2107.06383","last_updated":"2021-07-13T20:48:12Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T22:40:13.912253Z","submitted_at":"2021-07-13T20:48:12Z","title":"How Much Can CLIP Benefit Vision-and-Language Tasks?"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 20 inbound Pith citation observations for arXiv:2107.06383."}