{"as_of":"2026-08-10T12:27:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3136c696bd4264f986b3dcb798ba0796be939dab5706b345bb30152a1016cd4a","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T17:09:26.916926Z","state":"measured"},{"denominator":24,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":24,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00965/citation-record","integrity":"/paper/2502.00965/integrity","json":"/paper/2502.00965/citation-record.json","paper":"/paper/2502.00965"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-09T17:09:26.814720Z","title":"Preprint, arXiv:2309.17425","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.814720Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:bea73a0953f9953b85b916a37d642304f95cf0a140efdee3c070542151c3d489","observation_id":"9bffacab-8da9-4c87-bcfe-362947f1ec7d","resolution":{"observed_at":"2026-08-09T17:09:26.814720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-10T10:13:42.613798Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-09T17:09:26.819582Z","title":"Preprint, arXiv:2101.03961","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.819582Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:c464584b1c1880645b1c8be8c6ce56fc3a98807e6b0d72e5f70a9983a564e65d","observation_id":"1c977b14-1ae5-4930-b694-88480c28e905","resolution":{"observed_at":"2026-08-09T17:09:26.819582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09263","last_updated":"2022-10-17T17:11:36Z","snapshot_observed_at":"2026-08-04T21:13:07.755374Z","submitted_at":"2022-10-17T17:11:36Z","title":"Vision-Language Pre-training: Basics, Recent Advances, and Future Trends","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09263","snapshot_observed_at":"2026-08-09T17:09:26.824870Z","title":"Preprint, arXiv:2210.09263","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.824870Z"},"links":{"cited_paper":"/paper/2210.09263","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:2d7da0ed31ae230e6ac9f9bcef95b92ebe725927412667d4efa955ac9532ff07","observation_id":"da12ef41-fa2a-409e-a021-33b89bf382af","resolution":{"observed_at":"2026-08-09T17:09:26.824870Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.05055","last_updated":"2023-02-17T17:54:50Z","snapshot_observed_at":"2026-07-06T14:28:52.486524Z","submitted_at":"2022-12-09T18:57:37Z","title":"Sparse Upcycling: Training Mixture-of-Experts from Dense Checkpoints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.05055","snapshot_observed_at":"2026-08-09T17:09:26.829582Z","title":"Preprint, arXiv:2212.05055","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.829582Z"},"links":{"cited_paper":"/paper/2212.05055","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:16fad45719e901dbf381a6ab55f0e85c3427d1e0a2624eec9066cd23d035c8ba","observation_id":"1a60b733-af98-4b83-aada-8d63d804d106","resolution":{"observed_at":"2026-08-09T17:09:26.829582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-09T17:09:26.838908Z","title":"Preprint, arXiv:2304.08485","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.838908Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:3a2b761e724d7f23d2a2966bec74b8854fc6033bf39a7d0def5804217a8d03b9","observation_id":"be150f40-1a03-43f1-873f-2eec9a0514fd","resolution":{"observed_at":"2026-08-09T17:09:26.838908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.02770","last_updated":"2022-06-06T17:51:59Z","snapshot_observed_at":"2026-08-04T16:17:44.927802Z","submitted_at":"2022-06-06T17:51:59Z","title":"Multimodal Contrastive Learning with LIMoE: the Language-Image Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.02770","snapshot_observed_at":"2026-08-09T17:09:26.844565Z","title":"Preprint, arXiv:2206.02770","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.844565Z"},"links":{"cited_paper":"/paper/2206.02770","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:858ecf98b444609b01584959b503f2d3da1e4931219ae028406e6fab84f970ef","observation_id":"52e583d0-4c1a-4a57-a591-15db071bef13","resolution":{"observed_at":"2026-08-09T17:09:26.844565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-09T17:09:26.854146Z","title":"Preprint, arXiv:1910.10683","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.854146Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:0df88ed59126b67fba6d17fe27834c2c92e3be7d9d1ad3424ffc1e3fad47b618","observation_id":"7173aa85-6603-4035-a46b-915379cdb175","resolution":{"observed_at":"2026-08-09T17:09:26.854146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-09T17:09:26.859300Z","title":"Preprint, arXiv:2102.12092","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.859300Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:73b1fa65908dfe2a4d57b53c2c898a689f04c6298338c49690c94dfc0789ba8d","observation_id":"03148481-167a-4e91-b3ed-651a88b27d76","resolution":{"observed_at":"2026-08-09T17:09:26.859300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.01518","last_updated":"2022-03-21T08:27:06Z","snapshot_observed_at":"2026-07-06T12:14:49.815939Z","submitted_at":"2021-12-02T18:59:32Z","title":"DenseCLIP: Language-Guided Dense Prediction with Context-Aware Prompting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.01518","snapshot_observed_at":"2026-08-09T17:09:26.864663Z","title":"Preprint, arXiv:2112.01518","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.864663Z"},"links":{"cited_paper":"/paper/2112.01518","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:3a431e1f99af3c7f48bce25082a5fbb1fc2567ca0a94f4a818865e2e07c9a5d8","observation_id":"cc713ba7-fd57-4c3d-8156-fb3db9a093c0","resolution":{"observed_at":"2026-08-09T17:09:26.864663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01739","last_updated":"2024-03-27T10:21:24Z","snapshot_observed_at":"2026-08-02T08:17:59.108390Z","submitted_at":"2024-01-29T12:05:02Z","title":"OpenMoE: An Early Effort on Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01739","snapshot_observed_at":"2026-08-09T17:09:26.890649Z","title":"Preprint, arXiv:2402.01739","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.890649Z"},"links":{"cited_paper":"/paper/2402.01739","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:ddcf29bbc16654071f43546f5f9145cbbaa85fdb306d60998686cd5900fe0d3d","observation_id":"82585d86-4371-4a62-9803-c3bf8b167c9e","resolution":{"observed_at":"2026-08-09T17:09:26.890649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12399","last_updated":"2024-02-21T13:33:12Z","snapshot_observed_at":"2026-08-09T07:38:33.051650Z","submitted_at":"2024-02-17T06:23:27Z","title":"Turn Waste into Worth: Rectifying Top-$k$ Router of MoE","version":2},"cited_work":{"arxiv_id":"2402.12399","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12399","snapshot_observed_at":"2026-08-09T17:09:26.985188Z","title":"Turn Waste into Worth: Rectifying Top-$k$ Router of MoE","venue":"cs.LG","work_id":"060defc6-ed4a-42ae-be2f-01cef024f696","year":2024},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.896521Z"},"links":{"cited_paper":"/paper/2402.12399","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:10aaa322943f158131260e8a9416782a5c236a766271f0e7f6bebf7eb00e09de","observation_id":"1924bb8f-5b51-4c80-bbda-4a0092bb44ed","resolution":{"observed_at":"2026-08-09T17:09:26.993491Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19291","last_updated":"2025-05-28T10:03:54Z","snapshot_observed_at":"2026-07-06T19:23:50.186410Z","submitted_at":"2024-09-28T09:28:51Z","title":"CLIP-MoE: Towards Building Mixture of Experts for CLIP with Diversified Multiplet Upcycling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19291","snapshot_observed_at":"2026-08-09T17:09:26.901121Z","title":"Preprint, arXiv:2409.19291","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.901121Z"},"links":{"cited_paper":"/paper/2409.19291","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:8515b4a0323a9f8a693f487062930a470edc8de8c5deeea98427b33c26840d78","observation_id":"d6728183-3897-4491-a6dd-cd8545816c68","resolution":{"observed_at":"2026-08-09T17:09:26.901121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08906","snapshot_observed_at":"2026-08-09T17:09:26.906465Z","title":"Preprint, arXiv:2202.08906","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.906465Z"},"links":{"cited_paper":"/paper/2202.08906","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:10e082a865a5cfde2f8c7bdb907d54bc3164191be126ea097f3d0a8689a5a67c","observation_id":"16a50ade-f423-4e41-b014-881d15b63744","resolution":{"observed_at":"2026-08-09T17:09:26.906465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:09:27.263213Z","title":"Table 3 summarizes the hyper-parameters for all experiments, including MoE-specific configurations and parameters for dense CLIP, sparse CLIP, and CLIP-UP","venue":null,"work_id":"d94487b1-f1a2-4a5a-aa80-a261b2864b29","year":2023},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.911883Z"},"links":{"citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:7c08af4f7345c1ecf6083f9fe4762c0c0b3e2c616642c6c66bed61779b017cf5","observation_id":"be1f5a7e-1c6f-4175-bcf0-af57ce103252","resolution":{"observed_at":"2026-08-09T17:09:27.269015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:09:27.247813Z","title":"We also explore the effect of adding MoE layers to only one modality while keeping the other modality fully dense","venue":null,"work_id":"94008911-d77b-4ddd-a1fa-5ada77bc71cf","year":2019},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.916926Z"},"links":{"citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:065aec2514e1e1f3f705fe0605aee633923058d87f7cd5d6411b47a58a793213","observation_id":"7b878faf-4901-46b7-a7b9-6e30deae155b","resolution":{"observed_at":"2026-08-09T17:09:27.252859Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:09:27.294007Z","title":"In 2009 IEEE conference on computer vision and pattern recognition , pages 248–255","venue":null,"work_id":"331abda8-d520-4e7f-b178-595c2c6ae108","year":2009},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.804785Z"},"links":{"citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:0c3adefc001cdeadfb446e6bb202b37c65fdeb2c273594b1df8a605cc2108703","observation_id":"3684fb01-c0a0-45d1-a549-2a8c9cfd5f22","resolution":{"observed_at":"2026-08-09T17:09:27.298745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:09:27.278901Z","title":"In Computer Vision– ECCV 2014: 13th European Conference, Zurich, Switzerland, September 6-12, 2014, Proceedings, Part V 13, pages 740–755","venue":null,"work_id":"11c97e1e-5ec7-4e83-9b62-a15dadfea50d","year":2014},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.834581Z"},"links":{"citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:53c5791c71c6e8a9ab59a61309bb01db2c426da41d8539390b23bae091037adc","observation_id":"3d880762-b503-4d91-8970-3018eeb334de","resolution":{"observed_at":"2026-08-09T17:09:27.283980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-09T17:09:26.875283Z","title":"Preprint, arXiv:1701.06538","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.875283Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:7d7f5815e026a347ccc7eb86a6004fcf02bbf53e2674931f2169a74f9704deb6","observation_id":"d8e821b2-48af-4d2c-8062-ee3f01a9c005","resolution":{"observed_at":"2026-08-09T17:09:26.875283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10811","last_updated":"2019-06-12T17:42:33Z","snapshot_observed_at":"2026-08-07T19:33:21.437256Z","submitted_at":"2019-02-13T20:35:44Z","title":"Do ImageNet Classifiers Generalize to ImageNet?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.10811","snapshot_observed_at":"2026-08-09T17:09:26.869436Z","title":"Vaishaal Shankar, Rebecca Roelofs, Horia Mania, Alex Fang, Benjamin Recht, and Ludwig Schmidt","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.869436Z"},"links":{"cited_paper":"/paper/1902.10811","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:5ace1a77c239e1fd5ba6daafd6312a5764db4dbbddaa53205582222ea10a19df","observation_id":"e2a30d28-153b-4394-9b44-cd6a3fa9114d","resolution":{"observed_at":"2026-08-09T17:09:26.869436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04745","last_updated":"2020-06-29T07:55:12Z","snapshot_observed_at":"2026-08-06T10:39:08.684653Z","submitted_at":"2020-02-12T00:33:03Z","title":"On Layer Normalization in the Transformer Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04745","snapshot_observed_at":"2026-08-09T17:09:26.885274Z","title":"Preprint, arXiv:2002.04745","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.885274Z"},"links":{"cited_paper":"/paper/2002.04745","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:e8fbbfb87ef7bebc7ff45472b1ab370d32dd1fb527105d31d0b110c2b4034553","observation_id":"decf3f13-ba02-4a25-8e07-9200ba122b8a","resolution":{"observed_at":"2026-08-09T17:09:26.885274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-09T17:09:26.849221Z","title":"Preprint, arXiv:2103.00020","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.849221Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:a20ac5ff3c4c66bc8b0d1677e71f4203805750ae9366881acfc887ab751c2d04","observation_id":"6afed1b1-27c8-4fb3-b00d-3db306e01d99","resolution":{"observed_at":"2026-08-09T17:09:26.849221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.06905","last_updated":"2022-08-01T21:07:58Z","snapshot_observed_at":"2026-07-06T12:18:14.988251Z","submitted_at":"2021-12-13T18:58:19Z","title":"GLaM: Efficient Scaling of Language Models with Mixture-of-Experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.06905","snapshot_observed_at":"2026-08-09T17:09:26.809525Z","title":"Preprint, arXiv:2112.06905","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.809525Z"},"links":{"cited_paper":"/paper/2112.06905","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:51422e15842b6a16886c339d8949e4c025ee25b6c3b2498699da47543e8ab064","observation_id":"750675db-14cd-4cb7-83bb-84120156c793","resolution":{"observed_at":"2026-08-09T17:09:26.809525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T17:09:27.309522Z","title":"In 2023 IEEE/CVF Conference on Computer Vision and Pattern Recog- nition (CVPR)","venue":null,"work_id":"0c524a9c-2209-46a7-9cac-943528db27b5","year":2023},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.798365Z"},"links":{"citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:37528a7ecfdbc62ba0a759df50fdfc227e360c3592a620286bf64f8700aaaa11","observation_id":"ba1bdd70-dc95-4b9c-a37f-ac6ef1df080d","resolution":{"observed_at":"2026-08-09T17:09:27.314960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.07952","last_updated":"2024-03-17T06:49:19Z","snapshot_observed_at":"2026-07-06T15:42:10.592303Z","submitted_at":"2023-06-13T17:51:18Z","title":"MOFI: Learning Image Representations from Noisy Entity Annotated Images","version":3},"cited_work":{"arxiv_id":"2306.07952","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.07952","snapshot_observed_at":"2026-08-09T17:09:27.041274Z","title":"MOFI: Learning Image Representations from Noisy Entity Annotated Images","venue":"cs.CV","work_id":"9832a59f-e96a-4344-8f8a-7dd5dd81e5c8","year":2023},"citing_paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-09T17:09:26.879958Z"},"links":{"cited_paper":"/paper/2306.07952","citing_paper":"/paper/2502.00965"},"observation_digest":"sha256:6bc335c448acd72f59b37be9587cbd8b138054c71d37421e5fb1bf2ac56981ea","observation_id":"885737dc-3bb5-4e01-8bfd-118a96a130c7","resolution":{"observed_at":"2026-08-09T17:09:27.046348Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00965","last_updated":"2025-05-25T17:39:32Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T17:29:31.414202Z","submitted_at":"2025-02-03T00:04:50Z","title":"CLIP-UP: A Simple and Efficient Mixture-of-Experts CLIP Training Recipe with Sparse Upcycling"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 0 inbound Pith citation observations for arXiv:2502.00965."}