{"as_of":"2026-08-09T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8b8ca3a1cab9c6780cf1219f0cad26060549a1396febc494a8c27f414574918b","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T23:41:44.214299Z","state":"measured"},{"denominator":49,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":49,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-11T03:31:33.964471Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T03:40:54.141854Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"cited_work":{"arxiv_id":"2506.16673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.16673 , year=","venue":null,"work_id":"06100205-6ec7-495f-8ffd-2d4bc07cea60","year":null},"citing_paper":{"arxiv_id":"2605.07271","last_updated":"2026-05-08T05:35:32Z","snapshot_observed_at":"2026-07-06T23:19:41.053744Z","submitted_at":"2026-05-08T05:35:32Z","title":"Understanding Performance Collapse in Layer-Pruned Large Language Models via Decision Representation Transitions","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-11T02:23:52.589354Z"},"links":{"cited_paper":"/paper/2506.16673","citing_paper":"/paper/2605.07271"},"observation_digest":"sha256:66d3b3e805c44ed25519432cd5903eb35cbd075d4fefee3b30907748ea91f789","observation_id":"cddb2aaa-c23f-4a4c-ae77-8b645044def7","resolution":{"observed_at":"2026-05-11T02:25:53.878606Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"cited_work":{"arxiv_id":"2506.16673","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.16673","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2506.16673 , year=","venue":null,"work_id":"06100205-6ec7-495f-8ffd-2d4bc07cea60","year":null},"citing_paper":{"arxiv_id":"2605.07783","last_updated":"2026-05-08T14:21:05Z","snapshot_observed_at":"2026-07-06T23:20:06.574823Z","submitted_at":"2026-05-08T14:21:05Z","title":"Chain-based Distillation for Effective Initialization of Variable-Sized Small Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-11T03:31:33.964471Z"},"links":{"cited_paper":"/paper/2506.16673","citing_paper":"/paper/2605.07783"},"observation_digest":"sha256:1407476b87758738b56b3027c8eaa72a568fcaecfb4b787fa7154e454f14b96b","observation_id":"ce73f04e-e77b-4e33-a86e-6f8d47c2ade2","resolution":{"observed_at":"2026-05-11T03:40:54.143600Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.16673/citation-record","integrity":"/paper/2506.16673/integrity","json":"/paper/2506.16673/citation-record.json","paper":"/paper/2506.16673"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-06T23:41:39.653398Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.653398Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:ff936c22e3742c4e8b450499efb12a6500c07032e0df017e35fac610e39b9b83","observation_id":"bb0d8947-a5cd-476a-a08b-6a3b270f23f1","resolution":{"observed_at":"2026-08-06T23:41:39.653398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T23:41:40.603499Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.603499Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:26ebacdd241cfcffc5e7e5dca8ed04cf59f15e8f1349b6dad83e4cb82c272bd0","observation_id":"1210daea-a2a6-4b2a-8591-31dd5b9ec0f7","resolution":{"observed_at":"2026-08-06T23:41:40.603499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.783886Z","title":"Scaling up visual and vision-language representation learning with noisy text su- pervision","venue":null,"work_id":"37ab0d0b-27e1-40fb-aa14-68bfbfe57d95","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.818042Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:7caf23b2ee115f3d5646615941a415d986f97640473f3e1dee6541965d6462b4","observation_id":"8d20089f-b83f-4d4d-af8c-0e25addf1014","resolution":{"observed_at":"2026-08-06T23:41:46.787183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.774076Z","title":"Learning multiple layers of features from tiny im- ages.Handbook of Systemic Autoimmune Diseases, 1(4),","venue":null,"work_id":"9949acb2-0695-4d13-b30a-bf8eb0ddf4b7","year":2009},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.919321Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:e3136b7501e9750d09bb7953f6e205d2b160b0e37b0394f029fadc376e965bcd","observation_id":"e51020db-c6d2-4e42-8726-38decccecdf1","resolution":{"observed_at":"2026-08-06T23:41:46.777334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.763595Z","title":"Clipath: Fine-tune clip with visual fea- ture fusion for pathology image analysis towards min- imizing data collection efforts","venue":null,"work_id":"bd903ed9-1209-40c9-85a6-33c58f54904a","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.059755Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:3aeed48a4ce5767d1c40af94541483d805ae88787067554ceee2fcccc59c1964","observation_id":"77274896-7a07-4c53-bc8b-be4c9ac55907","resolution":{"observed_at":"2026-08-06T23:41:46.766897Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-06T23:41:41.156877Z","title":"Albert: A lite bert for self-supervised learning of lan- guage representations.ArXiv, abs/1909.11942,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.156877Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:029cb9caa7312273d00b148830c2390ddd2b7a53d9aa15249a56d61c3e9c721e","observation_id":"9f089dd5-871e-45fd-8274-8df9a9fc5a1f","resolution":{"observed_at":"2026-08-06T23:41:41.156877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.753044Z","title":"Align before fuse: Vision and language representation learning with momentum distilla- tion.Advances in neural information processing systems, 34:9694–9705,","venue":null,"work_id":"fc2a9ca4-c36c-4797-b32b-e57d130eee61","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.226742Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:cb470d7455de15602ee25efa97446a5e9595cde4b347dc970ff4cd37fb730bdb","observation_id":"942f3b57-1b3f-4ff5-aa75-1a36304224d2","resolution":{"observed_at":"2026-08-06T23:41:46.756791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:41.302093Z","title":"Blip-2: Bootstrapping language-image pre- training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.302093Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:fd49b15de1dc8d9dc24a7fe3a7dfdd7ced78e21e6c6ad27993d1340d39893a95","observation_id":"34d6268d-ed76-42af-b3aa-77edaa48c71d","resolution":{"observed_at":"2026-08-06T23:41:41.302093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.735011Z","title":"Automatic evaluation of machine translation quality using longest common subsequence and skip-bigram statistics","venue":null,"work_id":"e49cc3bd-c316-4185-bfdc-486f07265875","year":2004},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.381057Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:5a7d192433703730b3736e045031c5a5eb8428cc9f1e19786e368647d41905f0","observation_id":"983c5e6a-388b-4d59-8928-9ce5afa2e772","resolution":{"observed_at":"2026-08-06T23:41:46.738963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00928","last_updated":"2024-07-01T03:17:53Z","snapshot_observed_at":"2026-08-03T19:05:40.087675Z","submitted_at":"2024-07-01T03:17:53Z","title":"FoldGPT: Simple and Effective Large Language Model Compression Scheme","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00928","snapshot_observed_at":"2026-08-06T23:41:41.576024Z","title":"Foldgpt: Simple and effective large language model com- pression scheme.ArXiv, abs/2407.00928,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.576024Z"},"links":{"cited_paper":"/paper/2407.00928","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:1e6cc988be8223fbd5cdbf0aa7c12e921d5581ed264b5b3a0af9460e21a3c741","observation_id":"e4239e0a-3066-4fb3-9eaf-840639acf3d5","resolution":{"observed_at":"2026-08-06T23:41:41.576024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.717133Z","title":"Clip-branches: Interactive fine-tuning for text- image retrieval","venue":null,"work_id":"08d1d301-b44c-4532-8e1d-6ea5da6b3f23","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.680090Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:45b8f408e747938b646a5b822b901747ffc5e216352a568c6dc3871729a6bd40","observation_id":"78e710c1-ceb4-43b7-a2bc-32a33ff584d7","resolution":{"observed_at":"2026-08-06T23:41:46.721080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-07-06T12:09:52.161425Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-06T23:41:41.828926Z","title":"[Mokady and Hertz, 2021] Ron Mokady and Amir Hertz","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.828926Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:fe626f5ad010e00def0b3c3e9604b94356460ae6adda6466326df97ce76c8a5b","observation_id":"59700003-ea25-4573-9220-5fa415e5f49c","resolution":{"observed_at":"2026-08-06T23:41:41.828926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.707277Z","title":"Compact language models via pruning and knowledge distillation","venue":null,"work_id":"19cb318d-01a6-448a-b602-789aa1fe314d","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.888375Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:822d089165c1105aef60529817360cec9a2d07a31d7bcad4d983aa1eb1af33e4","observation_id":"55ca4b34-9252-4ad3-9b9b-57979f93adda","resolution":{"observed_at":"2026-08-06T23:41:46.710512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.697253Z","title":"CHiLS: Zero- shot image classification with hierarchical label sets","venue":null,"work_id":"7fb38640-4c37-46b9-825b-91846e64f51d","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.974012Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:29aec1b114940a543117597b3be8d72b59bc2cf2742977b4be8fab717cfbb15a","observation_id":"149bad71-fc54-4a54-929f-b7bfae66a016","resolution":{"observed_at":"2026-08-06T23:41:46.700607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.685843Z","title":null,"venue":null,"work_id":"f0c394c2-614f-43b7-818e-77e9f3d6ec55","year":2001},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.038682Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:973f6470266b84adb5195a433aa13485fd4d12ccbdcdcf7bba022eb2b28e1175","observation_id":"d22b41c4-e8de-4f9d-b8d1-42281a2efdb2","resolution":{"observed_at":"2026-08-06T23:41:46.690119Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:42.417659Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.417659Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:6f4fac30522ac42e75da27dc55bb84e251cca8b5798099611a0293ef82275e1d","observation_id":"1c4ace28-b9e0-45ec-a7f1-0dbdb30aa7ca","resolution":{"observed_at":"2026-08-06T23:41:42.417659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:42.525499Z","title":"Learning transferable visual models from nat- ural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.525499Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:de96d9aa2170bd12486a8fc141135d0b60ec15b04f75070630d49b0b42f600a8","observation_id":"e7913e60-7df6-4ba1-b8bb-b6570d741f7e","resolution":{"observed_at":"2026-08-06T23:41:42.525499Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.644612Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image captioning","venue":null,"work_id":"620c8cc6-6379-4319-a16e-7cb8cc5cc49c","year":2018},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.594229Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:8f05bde3fac256e0033c851a010e8c9b20edda30cbe7b8065a8cb34aeb4c8f78","observation_id":"a98d3e93-39aa-42b4-b253-5f8146c3135b","resolution":{"observed_at":"2026-08-06T23:41:46.648692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.623918Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":"d61bdacb-90da-45a6-a537-8c4f7aed2e2a","year":2017},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.730440Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:50b655432508ac1d6c4459bdbdfdc3c3dcc13c41b177cb48b13e71cda00b3dd7","observation_id":"87482803-e7a0-4381-952c-bae8b819c481","resolution":{"observed_at":"2026-08-06T23:41:46.627340Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.455720Z","title":"Characterizing and avoid- ing negative transfer","venue":null,"work_id":"cc59be89-9cee-4b50-a180-7ba57c58c43a","year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.923374Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:35e41d1542e49dbee9e6824a847455b9c7735099b21cc3ee21b335140203b2cd","observation_id":"f62f778a-ab77-42f5-ba9c-37c4ea823d8e","resolution":{"observed_at":"2026-08-06T23:41:46.597299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.167353Z","title":"Learngene: From open-world to your learning task","venue":null,"work_id":"ceec54ab-8ffc-44e0-8d77-c746e34f2f0d","year":2022},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.944359Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:5ab7fc7ca8512cb6c84c8fccb8db1700e8a27b8d721a2df682ecdd33c14120b8","observation_id":"8b136c55-2dc0-455d-87f1-4f9dd86c18f7","resolution":{"observed_at":"2026-08-06T23:41:46.291286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02279","last_updated":"2023-06-29T14:04:26Z","snapshot_observed_at":"2026-08-01T12:20:53.734135Z","submitted_at":"2023-05-03T17:15:58Z","title":"Learngene: Inheriting Condensed Knowledge from the Ancestry Model to Descendant Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02279","snapshot_observed_at":"2026-08-06T23:41:43.035082Z","title":"Learngene: Inheriting con- densed knowledge from the ancestry model to descendant models.arXiv preprint arXiv:2305.02279,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.035082Z"},"links":{"cited_paper":"/paper/2305.02279","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:6ca3541b4b23e4dfba031740c5729ac26760565795151996e21e776105a67bd7","observation_id":"8ec5d236-9419-43ea-ae21-f9ceb50cc882","resolution":{"observed_at":"2026-08-06T23:41:43.035082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.154797Z","title":"Vision transformers as probabilistic expan- sion from learngene","venue":null,"work_id":"6e8963fa-7996-4eba-b815-6e7e74d9d2c8","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.198681Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:cec6d403d61d4037d1c9d2b67b5a0c33940e8cfae0ed9f9a3def3851c201556d","observation_id":"a355136e-4ae3-4159-beae-2294fd60338a","resolution":{"observed_at":"2026-08-06T23:41:46.158677Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16897","last_updated":"2024-04-25T06:04:34Z","snapshot_observed_at":"2026-07-06T18:05:46.922400Z","submitted_at":"2024-04-25T06:04:34Z","title":"Exploring Learngene via Stage-wise Weight Sharing for Initializing Variable-sized Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16897","snapshot_observed_at":"2026-08-06T23:41:43.321605Z","title":"Exploring learngene via stage-wise weight sharing for initializing variable-sized models.arXiv preprint arXiv:2404.16897,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.321605Z"},"links":{"cited_paper":"/paper/2404.16897","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:83ac4557c6d78988d97f9a90c65448dc7a567253660ee36843fd91b44e29d758","observation_id":"a023133f-f8b6-4034-acdd-d7b6fd96b9ca","resolution":{"observed_at":"2026-08-06T23:41:43.321605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07337","last_updated":"2025-05-20T17:08:45Z","snapshot_observed_at":"2026-08-02T05:15:10.456595Z","submitted_at":"2024-08-14T07:22:28Z","title":"KIND: Knowledge Integration and Diversion for Training Decomposable Models","version":2},"cited_work":{"arxiv_id":"2408.07337","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.07337","snapshot_observed_at":"2026-08-06T23:41:44.688842Z","title":"KIND: Knowledge Integration and Diversion for Training Decomposable Models","venue":"cs.CV","work_id":"1ad00004-f38e-4c95-857d-a6ed9ae6454a","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.487929Z"},"links":{"cited_paper":"/paper/2408.07337","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:cbae6cf564f9cf2b958a978d9441982f408eb33f76943ffd4bf5147ddebf020d","observation_id":"996b9d26-f958-4d91-8ac7-493294c8f537","resolution":{"observed_at":"2026-08-06T23:41:44.756302Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09441","last_updated":"2024-12-16T11:26:26Z","snapshot_observed_at":"2026-07-06T19:02:03.017798Z","submitted_at":"2024-08-18T11:23:21Z","title":"CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09441","snapshot_observed_at":"2026-08-06T23:41:43.615143Z","title":"Clip-cid: Efficient clip distillation via cluster-instance discrimination.ArXiv, abs/2408.09441,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.615143Z"},"links":{"cited_paper":"/paper/2408.09441","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:65c6076fb13ae4ea92645f369d4101ea97bc057cc03e8314d37b539fa83418a3","observation_id":"ceb347dc-1b90-4c89-aef2-57be930a8a3b","resolution":{"observed_at":"2026-08-06T23:41:43.615143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.011817Z","title":null,"venue":null,"work_id":"69e365a6-ae6b-4554-94ad-58f1e20e8ebb","year":2014},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.735490Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:ca8bea52c391386d044ffbdbeca8b88652ddcbd22ca13d97f2b3187bca598642","observation_id":"70dfdb34-7ca4-40d8-9c41-b1766c1acbcd","resolution":{"observed_at":"2026-08-06T23:41:46.137224Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:45.739181Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"6c078153-1513-4013-9861-97a1e8726a40","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.840052Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:7b3ba823befe0009f8fe1dcd4c8ea388e9a1693664f34852b81aa6ac9b852f69","observation_id":"2082631f-286b-4761-b5a2-68274aff7dbd","resolution":{"observed_at":"2026-08-06T23:41:45.888512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:45.414529Z","title":"Minivit: Compressing vision transformers with weight multiplexing","venue":null,"work_id":"29db6d99-021d-4bcc-85e6-612aec3424ba","year":2022},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:43.907351Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:2c16c54abbb10586bbee4fa488e6aa9c34ba94b320c8f745263eb1cbdba510f8","observation_id":"13984ce2-e02d-4297-8d68-991175959fc3","resolution":{"observed_at":"2026-08-06T23:41:45.576440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02582","last_updated":"2024-01-05T00:26:07Z","snapshot_observed_at":"2026-07-06T17:11:50.961895Z","submitted_at":"2024-01-05T00:26:07Z","title":"CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02582","snapshot_observed_at":"2026-08-06T23:41:44.018505Z","title":"Cocot: Contrastive chain-of-thought prompting for large multimodal models with multiple image inputs.arXiv preprint arXiv:2401.02582,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:44.018505Z"},"links":{"cited_paper":"/paper/2401.02582","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:badaba8cac4765443ba9f36e28b31aaaa5e190289129a6b3cb76bb9c5f874ab4","observation_id":"db9e8f2c-82da-40c2-9525-65d048c539d0","resolution":{"observed_at":"2026-08-06T23:41:44.018505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:45.191913Z","title":"Learning clip guided visual- text fusion transformer for video-based pedestrian attribute recognition","venue":null,"work_id":"f7d31fec-e440-474a-8959-e01b527e2701","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:44.116542Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:30e139d622a2a5d66404939fbb6ec7d37d1d75d094c06fcc1fab62348e2c0cf9","observation_id":"0ee55134-129c-450b-b7d0-5db5854a84ca","resolution":{"observed_at":"2026-08-06T23:41:45.302679Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"7653.5584","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:44.445493Z","title":"8 with the loss weightλ set to1","venue":null,"work_id":"33b811e4-f4e9-47bc-b198-07753e81cd83","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:44.214299Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:ec854fd2c2b52f9193464eca9163946e9ac2d8af819c4a21d666a0ec4a661a78","observation_id":"64496046-0093-4afe-b0ab-3ea71dd38fb8","resolution":{"observed_at":"2026-08-06T23:41:44.546243Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:42.159844Z","title":"Cats and dogs","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2001,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.159844Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:81c917ccd3b78f0a5763115137357c07a69a23f5bec993ee8500b9f2dcb12bde","observation_id":"98ba2ed7-0ac0-4d72-8e15-208b5f67e433","resolution":{"observed_at":"2026-08-06T23:41:42.159844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:41.496223Z","title":"Microsoft coco: Com- mon objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:41.496223Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:470a3c9926289a6374b2c49165c2afc0eb83e99de99e0a383448bdd2820ee5f7","observation_id":"c309051c-b47c-4cb4-aa55-c012e17239d6","resolution":{"observed_at":"2026-08-06T23:41:41.496223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.805312Z","title":"Bert: Pre-training of deep bidirectional transformers for language understand- ing","venue":null,"work_id":"74dcb712-88f0-451a-9c88-30e20495e629","year":2019},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.172526Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:2ee16dfa3aec58ee3996f3ba3bb5cc10137cf24e7a0a5f1d27a037c987d57dbd","observation_id":"a7a89bf2-2990-40f3-abc5-b4dcd4f3ff9b","resolution":{"observed_at":"2026-08-06T23:41:46.809002Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.669036Z","title":"Clipping: Distilling clip-based models with a stu- dent base for video-language retrieval","venue":null,"work_id":"e1c0fb1a-946d-4152-baa9-95a6df2a318e","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2012,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.268837Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:84bb5b0ac45faacf5087d71da804860213842336de28f721f51d70b422b6a06e","observation_id":"6005b785-7aaf-4522-895b-91e43ca15514","resolution":{"observed_at":"2026-08-06T23:41:46.673029Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.836360Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":"d115802f-44d7-4782-a9f3-62b143066e73","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.926867Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:8fd9569a1209e1271dde4776313b5418ca7622ce340c0cddc7bf1a9ea7b47e54","observation_id":"fefd7bed-e213-4290-b97c-7aa5e6336261","resolution":{"observed_at":"2026-08-06T23:41:46.839841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.794789Z","title":"Openclip, July","venue":null,"work_id":"601d077f-6d60-419c-ad2f-cbc637c3088e","year":2021},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.705044Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:64d3ec40f75019ec064c13c2614f7255650ee29aab4c63e097a7f46ac2c9649e","observation_id":"02cce5a3-27e0-4c63-b4aa-0d7b7c05fe3e","resolution":{"observed_at":"2026-08-06T23:41:46.798397Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.853204Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality- experts.Advances in Neural Information Processing Sys- tems, 35:32897–32912,","venue":null,"work_id":"2d4a4249-32b9-4a64-ae93-b6f648b9ecc6","year":2022},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.722053Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:9769658f763070639909849abe02a9fc7dc981b3d708aad9f785823133c27a61","observation_id":"0f226c26-7bbe-4ff2-a102-1d8c3ee06c94","resolution":{"observed_at":"2026-08-06T23:41:46.856955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.612125Z","title":"Lawrence Zitnick, and Devi Parikh","venue":null,"work_id":"c16a07e8-0e37-4a28-ac03-b458fa8f4ace","year":2015},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.843705Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:1feebdb95f1e584c477e4c4085463dc316d3fbb2222736f8fd9aea0e73d726bf","observation_id":"8661aa16-e518-4425-bef4-13ac93d6980a","resolution":{"observed_at":"2026-08-06T23:41:46.616326Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.634335Z","title":"Building variable- sized models via learngene pool","venue":null,"work_id":"b6f7cb9a-4791-4918-b375-b82e46b37add","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:42.654304Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:4ec1f62ff1beb2ab491f68202bf5f239d47b9a97fe39d4f6d99ea26c622e70a2","observation_id":"0da41141-771f-40f8-aeda-fcc84f6ac6df","resolution":{"observed_at":"2026-08-06T23:41:46.637519Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-06T23:41:40.275604Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.275604Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:40a6793c2cd9af514d6f176537f74d29af474d9f3f65774dc673cbfeabaeea48","observation_id":"73c67a20-8c1a-40ae-bdf5-6971a45b3686","resolution":{"observed_at":"2026-08-06T23:41:40.275604Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.08139","last_updated":"2024-01-16T06:18:11Z","snapshot_observed_at":"2026-08-03T21:21:39.295155Z","submitted_at":"2024-01-16T06:18:11Z","title":"Transferring Core Knowledge via Learngenes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.08139","snapshot_observed_at":"2026-08-06T23:41:40.379368Z","title":"Transferring core knowledge via learngenes.arXiv preprint arXiv:2401.08139,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.379368Z"},"links":{"cited_paper":"/paper/2401.08139","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:cc65e3dea2f8238da7d9a3ad08be41c9db525dc66feb7eb7885fc13a51d33d89","observation_id":"f24fbc33-3743-436b-89f8-99ac3074417b","resolution":{"observed_at":"2026-08-06T23:41:40.379368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:46.823967Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":"5c9f7867-8d97-4af0-bde3-ee568fc57fb0","year":2023},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.005207Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:b253ad6ec3e5881328654e26cdab1097b9e5fd64b5f69d327772b780f1f6a6c8","observation_id":"59e47a0f-3e1a-43cd-b200-b7144e282dc5","resolution":{"observed_at":"2026-08-06T23:41:46.829621Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:39.837013Z","title":"Food-101–mining discriminative com- ponents with random forests","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:39.837013Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:d71d4e05ce10ef269c8a6bbd688561ca62797cdcfb85c0e5a3c6f09c33628a1b","observation_id":"2a080e28-5759-4fe3-ad22-af9afa26175d","resolution":{"observed_at":"2026-08-06T23:41:39.837013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T23:41:40.089980Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.089980Z"},"links":{"citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:0043cad674c71349007fa90ef15fc5c9202659f80a56f81db8e5c3620e612230","observation_id":"9612f030-0cc3-4c8e-b862-f57471afba35","resolution":{"observed_at":"2026-08-06T23:41:40.089980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17503","last_updated":"2025-03-15T17:21:38Z","snapshot_observed_at":"2026-07-06T18:36:42.830927Z","submitted_at":"2024-06-25T12:43:33Z","title":"WAVE: Weight Templates for Adaptive Initialization of Variable-sized Models","version":3},"cited_work":{"arxiv_id":"2406.17503","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.17503","snapshot_observed_at":"2026-08-06T23:41:44.920006Z","title":"WAVE: Weight Templates for Adaptive Initialization of Variable-sized Models","venue":"cs.LG","work_id":"57c3eb61-38ab-4771-8423-02618b6c8272","year":2024},"citing_paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T23:41:40.522210Z"},"links":{"cited_paper":"/paper/2406.17503","citing_paper":"/paper/2506.16673"},"observation_digest":"sha256:8fcd6921cec08be497efe6b62bf45452543297133a3177f2ec5287ce7292ce12","observation_id":"1645c199-146a-4897-910e-bac736c52528","resolution":{"observed_at":"2026-08-06T23:41:45.019297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.16673","last_updated":"2025-06-20T01:17:41Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T23:35:14.655780Z","submitted_at":"2025-06-20T01:17:41Z","title":"Extracting Multimodal Learngene in CLIP: Unveiling the Multimodal Generalizable Knowledge"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":3,"verified_fuzzy":24},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 2 inbound Pith citation observations for arXiv:2506.16673."}