{"as_of":"2026-08-13T06:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ead97f47bda0f2f013636e4ded7524c733978748f3de9691acddb466718b8ffc","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:59:52.281615Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2411.14789/citation-record","integrity":"/paper/2411.14789/integrity","json":"/paper/2411.14789/citation-record.json","paper":"/paper/2411.14789"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.114205Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.114205Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:f9ba3343abd214cf9b4c7476b33ab6984076e7b785f75cd22180dc0adc3537bf","observation_id":"3667f728-116f-4d70-8df0-b86563989a6b","resolution":{"observed_at":"2026-08-12T14:59:52.114205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.783217Z","title":"Mobileclip: Fast image-text models through multi-modal reinforced training","venue":null,"work_id":"66bf4b88-d19a-4fae-86d9-8b6b68a15da9","year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.119201Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:983ad4667d746c4c6c08a9305061b4c6e396f671c611fa3b7e8372d95ea51e1a","observation_id":"7f3b4057-6abf-4e5c-ba0f-6635cd45248c","resolution":{"observed_at":"2026-08-12T14:59:52.788275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.123160Z","title":"Conceptual 12m: Pushing web-scale image-text pre-training to recognize long-tail visual concepts","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.123160Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:ccfbf9e151067dffbdf3a0ba365ed81f4e9e3bd6f40d450ca5237eb039b688cf","observation_id":"bd51ce5b-e1d3-47b9-939d-baad2c37c84a","resolution":{"observed_at":"2026-08-12T14:59:52.123160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.07783","last_updated":"2021-11-09T17:15:38Z","snapshot_observed_at":"2026-07-06T12:08:35.761426Z","submitted_at":"2021-11-09T17:15:38Z","title":"FILIP: Fine-grained Interactive Language-Image Pre-Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.07783","snapshot_observed_at":"2026-08-12T14:59:52.127302Z","title":"Filip: Fine-grained interactive language-image pre-training","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.127302Z"},"links":{"cited_paper":"/paper/2111.07783","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:a6014122969b89a4953fbfad5e9959f9b773bbad4b93b95b2f146be22bc3eed6","observation_id":"95ba7f40-9837-4a6a-96f4-48f3644cb71e","resolution":{"observed_at":"2026-08-12T14:59:52.127302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.765242Z","title":"Slip: Self-supervision meets language-image pre-training","venue":null,"work_id":"85f0e201-d12c-4f35-87b9-d0a28e5a80ab","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.131546Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:9bc50b8a33511ea602ea4d9a1f7f6f9314aa66b63065fda0b528c53337aeb8f4","observation_id":"772f5775-3f49-4cc9-96ca-86ee78d549a0","resolution":{"observed_at":"2026-08-12T14:59:52.768761Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05208","last_updated":"2022-03-14T08:53:07Z","snapshot_observed_at":"2026-08-07T07:07:45.501871Z","submitted_at":"2021-10-11T12:17:32Z","title":"Supervision Exists Everywhere: A Data Efficient Contrastive Language-Image Pre-training Paradigm","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.05208","snapshot_observed_at":"2026-08-12T14:59:52.135248Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.135248Z"},"links":{"cited_paper":"/paper/2110.05208","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:85c54e288ac323046531e1104e53ef4108691fe6cfe3b621e2d4a236d14bd63a","observation_id":"9e9d7ef6-4019-4fdb-ad6a-63b163c52140","resolution":{"observed_at":"2026-08-12T14:59:52.135248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.753902Z","title":"Unified contrastive learning in image-text-label space","venue":null,"work_id":"e7da00d8-e1fa-45f6-81cb-ee935ae07dda","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.139565Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:3985d3b8fba64accf399f77a7831db236e080316d6ee0772155d8a8055c25a5c","observation_id":"deefb527-540a-4655-a01e-204eb4de7628","resolution":{"observed_at":"2026-08-12T14:59:52.757540Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.741907Z","title":"Sigmoid loss for language image pre- training","venue":null,"work_id":"afd3b9ba-d5ae-4954-8c9e-05fcb4a3a43d","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.142687Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:eb7d7ff402a67b59df383e0737f7315ac49ff9bc3b314ba2bbbbaacb102b70f4","observation_id":"befa4a88-7088-4800-977f-9293a0e45170","resolution":{"observed_at":"2026-08-12T14:59:52.745608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.729437Z","title":"Blip: Bootstrapping language-image pre-training for unified vision-language understanding and generation","venue":null,"work_id":"a2471ec2-43aa-4b76-ab5e-f972d269088d","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.145599Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:47521ab594e200ba2b826e334790870a39da4b1aa7d1fc401a5688e753c8e76d","observation_id":"d224ba9a-6194-4892-b457-f70d39b92c84","resolution":{"observed_at":"2026-08-12T14:59:52.733608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-12T14:59:52.148493Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.148493Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:0f0c2df958f1c22b432c0f1a27c151dafaf1377e34a1b5277fcee2261b18fc7e","observation_id":"d2113434-c7b6-416a-b61d-d75c170e37ad","resolution":{"observed_at":"2026-08-12T14:59:52.148493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.151714Z","title":"Tinyclip: Clip distillation via affinity mimicking and weight inheritance","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.151714Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:775d3b7ae3e65b8f975b878382f036e9b78dee0425c396f4ea82366b23b7ce9d","observation_id":"0e814fee-c16d-467d-a4cc-56dc16025f96","resolution":{"observed_at":"2026-08-12T14:59:52.151714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.154940Z","title":"Clip-kd: An empirical study of clip model distillation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.154940Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:d40651be2de86897314af9270f9c8acbdac25ac09012eef991050e46210225ca","observation_id":"d09a2960-9757-4414-b699-6877ec18ba32","resolution":{"observed_at":"2026-08-12T14:59:52.154940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-12T14:59:52.157799Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.157799Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:966c6850fce217644087a08be1118716ebaf17ad994094b4a521bcf1007dda51","observation_id":"06934296-ab32-4eb8-921d-1b70242d165a","resolution":{"observed_at":"2026-08-12T14:59:52.157799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.161256Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.161256Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:6a17cff02f45bf438122274fcb090a7771d2e0627ccc9b0646d0f9a6454f009a","observation_id":"6da76b83-de18-419b-b00f-2480161d7073","resolution":{"observed_at":"2026-08-12T14:59:52.161256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.686535Z","title":"Alip: Adaptive language-image pre-training with synthetic caption","venue":null,"work_id":"e4c505e9-353f-44ba-af9d-573536646d6f","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.164341Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:2c9a33e491d8ec3a334482f2994dbdf06fe8235e6b124c596919af7f489abd3d","observation_id":"0046f2d9-6ffa-40b8-8898-93617acc3956","resolution":{"observed_at":"2026-08-12T14:59:52.689960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07699","last_updated":"2024-03-13T22:27:08Z","snapshot_observed_at":"2026-08-13T05:51:56.999684Z","submitted_at":"2023-10-11T17:49:13Z","title":"VeCLIP: Improving CLIP Training via Visual-enriched Captions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07699","snapshot_observed_at":"2026-08-12T14:59:52.167679Z","title":"From scarcity to efficiency: Improving clip training via visual-enriched captions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.167679Z"},"links":{"cited_paper":"/paper/2310.07699","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:fc2e5f9339dee9e41e9fdeb1891f9ea698da9ac5248f049b28a93f0cb30179bc","observation_id":"99f775da-c713-4249-abd7-54cd86e75a8d","resolution":{"observed_at":"2026-08-12T14:59:52.167679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.676145Z","title":"Metaformer is actually what you need for vision","venue":null,"work_id":"f9193165-9874-4cdb-a6fc-2bf4ede5ddb9","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.171120Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:328af7e0419557db75254555758e03ffac5affff91096ef2cfd809cb268a8795","observation_id":"36e15436-1244-43c3-8391-60b30af1edca","resolution":{"observed_at":"2026-08-12T14:59:52.679633Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.664777Z","title":"Deeply supervised salient object detection with short connections","venue":null,"work_id":"fa3a99bc-0a85-4d12-ae1e-2fe9ef0355e3","year":2017},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.174562Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:90e8047a9a34249dbf601ad31ded81117b227af85f0ba0a39a6a25379944386d","observation_id":"c8118bb7-c484-474a-83da-f2b90090f27f","resolution":{"observed_at":"2026-08-12T14:59:52.668728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.653106Z","title":"Cascaded partial decoder for fast and accurate salient object detection","venue":null,"work_id":"0f5e1156-d9b6-4322-8878-b8ddd58abcf4","year":2019},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.178714Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:259ea809f40559544a6120cba9b781717e6410e21b0112d380980a709626dad9","observation_id":"ecfb34f2-c296-4364-86e2-a67e3bae9621","resolution":{"observed_at":"2026-08-12T14:59:52.657079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-13T02:40:23.887636Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T14:59:52.182930Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.182930Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:f60d044dcdc069fcf91d6e9bebf51cf2210aa51d63623912d4eaeded45f02f9d","observation_id":"ec24a1d5-3abc-4585-ae60-f988163ab6d0","resolution":{"observed_at":"2026-08-12T14:59:52.182930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.186821Z","title":"Swin transformer: Hierarchical vision transformer using shifted windows","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.186821Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:a1caebb50377206507b6eac71e48c34d9029e17afafba03e51db6bbf1a773fbe","observation_id":"fd94dcaf-8fd9-41bc-acb9-11a1dab9fa50","resolution":{"observed_at":"2026-08-12T14:59:52.186821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.633832Z","title":"Less is more: Pay less attention in vision transformers","venue":null,"work_id":"04b287b5-b556-4863-9f31-b4f77217268c","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.190581Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:eb0b4e606856bcc225157406fccc5afe6d7be5ab2858799dd7a5f940f0b9c2db","observation_id":"abbf80c6-af9b-4da1-b80a-8f4a4d48a0d3","resolution":{"observed_at":"2026-08-12T14:59:52.637839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.621642Z","title":"Cmt: Convolutional neural networks meet vision transformers","venue":null,"work_id":"73883c8a-4f66-4cc7-aaec-87034695caf3","year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.194481Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:89f8f2bf05c5e09a6f94a4da6eba6f4a77bbf7e1bbd1399327f9bfd2d5453ed9","observation_id":"fd86234b-74ed-4a34-821a-ad2ef9365662","resolution":{"observed_at":"2026-08-12T14:59:52.625709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.608705Z","title":"Fastvit: A fast hybrid vision transformer using structural reparameterization","venue":null,"work_id":"f84d1825-62c8-48d2-83a0-43de5b4af0d0","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.200277Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:0badde48061df4506f3a3ea95820412ee6b11a88f9a7049a4e897bc8fc7a40d2","observation_id":"ddca9952-036c-4d8c-8fc8-ac33cd6bcebb","resolution":{"observed_at":"2026-08-12T14:59:52.613709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03819","last_updated":"2019-03-05T16:46:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-07-10T18:39:15Z","title":"Universal Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03819","snapshot_observed_at":"2026-08-12T14:59:52.205965Z","title":"Universal transformers","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.205965Z"},"links":{"cited_paper":"/paper/1807.03819","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:23cc39fee7503ed529c406da15f5fad130585300b113c81a7e65b55c53dd651e","observation_id":"97a4c6e0-62c2-4894-9c15-4ad64edd5671","resolution":{"observed_at":"2026-08-12T14:59:52.205965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.210190Z","title":"Perceiver: General perception with iterative attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.210190Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:2e2ceeface2cbe93a8431b102ec1592632f8986428d9b62c58470603ee27d0c4","observation_id":"e5f31a3b-c752-4246-8d4a-651867b554eb","resolution":{"observed_at":"2026-08-12T14:59:52.210190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.589676Z","title":"Sharing low rank conformer weights for tiny always-on ambient speech recognition models","venue":null,"work_id":"114238c9-95aa-4456-bf04-ff05ac3fd252","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.214395Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:25368abb680732dd95ba46828fa7c9c70ff97d63267293725b80ee9068f93552","observation_id":"645b9ae5-35a5-4397-b4ef-4028d0cb4d43","resolution":{"observed_at":"2026-08-12T14:59:52.593450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.08100","last_updated":"2020-05-16T20:56:25Z","snapshot_observed_at":"2026-08-08T15:18:32.322111Z","submitted_at":"2020-05-16T20:56:25Z","title":"Conformer: Convolution-augmented Transformer for Speech Recognition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.08100","snapshot_observed_at":"2026-08-12T14:59:52.219465Z","title":"Conformer: Convolution-augmented transformer for speech recognition","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.219465Z"},"links":{"cited_paper":"/paper/2005.08100","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:331276ddf23ba3f6bfc04176621babbdddc70a6cd8cb983d6b188e96238fdd3e","observation_id":"de702da3-e804-42f5-9342-b6696ed0b4fb","resolution":{"observed_at":"2026-08-12T14:59:52.219465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.578116Z","title":"Simplifying transformer blocks","venue":null,"work_id":"563853a9-18c4-452d-bd7f-529338494fab","year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.223873Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:f95148e8b6eb6b6fdf3fc88e8c557306f856d93df6d604d735b6ffe39e290218","observation_id":"19bc353d-c96a-4333-9622-b5e048a40494","resolution":{"observed_at":"2026-08-12T14:59:52.581833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.227589Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.227589Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:519b924da4e2c5e0d7024d5dccde3e0d291611f797ea3e92ccb76d8579082ce0","observation_id":"26350de0-be99-4fa9-aadd-01befde4bec1","resolution":{"observed_at":"2026-08-12T14:59:52.227589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.560054Z","title":"The shaped transformer: Attention models in the infinite depth-and-width limit","venue":null,"work_id":"014eeeb4-5015-42a3-8e59-cec826fc92fe","year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.232264Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:97bf37d22a3db765e07a33abd2df7e6a7333315c5884ded305bdbb98615d4a1c","observation_id":"011605a2-487f-4b23-815c-7495e8f36552","resolution":{"observed_at":"2026-08-12T14:59:52.564010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.01470","last_updated":"2019-07-02T15:56:20Z","snapshot_observed_at":"2026-08-03T14:16:36.317369Z","submitted_at":"2019-07-02T15:56:20Z","title":"Augmenting Self-attention with Persistent Memory","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.01470","snapshot_observed_at":"2026-08-12T14:59:52.236035Z","title":"Augmenting self-attention with persistent memory","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.236035Z"},"links":{"cited_paper":"/paper/1907.01470","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:aed82f13d8de1b4724b959c45b5220ee565a019bd1281e7d867a2fdd167ed6f0","observation_id":"5d5940fc-69ea-4bae-852d-4586dd2e2c14","resolution":{"observed_at":"2026-08-12T14:59:52.236035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.08707","last_updated":"2024-11-28T03:20:49Z","snapshot_observed_at":"2026-08-13T00:07:53.259160Z","submitted_at":"2024-05-14T15:48:36Z","title":"Beyond Scaling Laws: Understanding Transformer Performance with Associative Memory","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.08707","snapshot_observed_at":"2026-08-12T14:59:52.240108Z","title":"Beyond scaling laws: Understanding transformer performance with associative memory","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.240108Z"},"links":{"cited_paper":"/paper/2405.08707","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:a59a24209db6d6b371c7eeb7a8cef927ba683bc69f61c9fc03dc9a930e18443b","observation_id":"d4744f33-043d-4ad0-b297-e92d696d6a8e","resolution":{"observed_at":"2026-08-12T14:59:52.240108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T14:59:52.244204Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.244204Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:92c751ede0081627886bf7b1660d541842e7d6a4c7651f9096a6675dfd7df997","observation_id":"4a2d84b0-0353-4449-84eb-a5c79032403e","resolution":{"observed_at":"2026-08-12T14:59:52.244204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-08-10T15:05:25.558818Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-12T14:59:52.247115Z","title":"Coca: Contrastive captioners are image-text foundation models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.247115Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:71f5cc1e46be7a9a75c25a6d50a877b3ca39f9f8aa9d68eebd7b67fdb6053d3e","observation_id":"a43af1cc-e3a0-4340-9a0b-9d5d8037fd69","resolution":{"observed_at":"2026-08-12T14:59:52.247115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.250581Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models.Advances in Neural Information Processing Systems, 35:25278–25294, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.250581Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:f057910b73454039730e237b28ca4fcbc609e6aa722a7f923934ddbd673de622","observation_id":"57d172d9-f745-4b17-acf7-c7d30bbe706b","resolution":{"observed_at":"2026-08-12T14:59:52.250581Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.539506Z","title":"Rils: Masked visual reconstruction in language semantic space","venue":null,"work_id":"536c05b3-55f3-4245-a724-dd85de575ca1","year":2023},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.253198Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:de01df1d1945d6c57d11e3dd0a126658121e3c5de57533e9046ce4b7a0cdf47c","observation_id":"1ed292a2-cff2-4386-9a2c-90537d6deea3","resolution":{"observed_at":"2026-08-12T14:59:52.543998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.255907Z","title":"Extract free dense labels from clip","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.255907Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:719b43d11851542c6a959fad4de8c30dd2699dfd970b8a5e0c3ad5c6ca97ab0b","observation_id":"8e900ed7-dc7f-4e8d-b091-74c8b1ba186c","resolution":{"observed_at":"2026-08-12T14:59:52.255907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.517025Z","title":"Openclip repository, 2021","venue":null,"work_id":"12a3640d-c4e5-40e5-982a-4ab352b63b0a","year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.258639Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:19c44bfe1493fd2c051afb4be457b728631139a6a20081c5c22eb09117ce6f54","observation_id":"a2a50556-d133-47dc-bc8d-39e181098183","resolution":{"observed_at":"2026-08-12T14:59:52.520710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.261429Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.261429Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:1ff226feb75f74e86253d6ef87f03da99dfcd599384db4f278493131309c2394","observation_id":"f7f7c6fd-a8e6-4aab-911b-4e83350e8020","resolution":{"observed_at":"2026-08-12T14:59:52.261429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.264271Z","title":"Do imagenet classifiers generalize to imagenet? In International conference on machine learning, pages 5389–5400","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.264271Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:221d221c11ae555687f4874096f6aff55182e0bb39a45f3ed305dbbbd1051d3d","observation_id":"4241ff8b-9f35-40f9-bf3d-38bb0188fd6d","resolution":{"observed_at":"2026-08-12T14:59:52.264271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.267287Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.267287Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:b6d368cce77138c775cc3fb38c6aef478bb9697192cfbf76164074ffc8510fc2","observation_id":"f0d35b14-1eaa-45ee-b25b-470128a85c44","resolution":{"observed_at":"2026-08-12T14:59:52.267287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.270399Z","title":"Learning robust global representations by penalizing local predictive power","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.270399Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:6505da36da2aecaa9b35620984d40dba34ff3c77af39093d37c7e75cafcc5606","observation_id":"c38f53c5-6c36-4c81-917b-9db95a4c2a22","resolution":{"observed_at":"2026-08-12T14:59:52.270399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.273910Z","title":"Microsoft coco: Common objects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.273910Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:030478e53a2d423833e4a719988bb5d2de145fb95a796166b3a49e4ed2a48f50","observation_id":"7d573126-e6cb-48ac-b674-e921a159f385","resolution":{"observed_at":"2026-08-12T14:59:52.273910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.277763Z","title":"Flickr30k entities: Collecting region-to-phrase correspondences for richer image-to-sentence models","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.277763Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:6eee72def396f3adb1a6403e600d68c32edf29abf144e9974f65ba328dacd5b4","observation_id":"84f5fab0-faaf-4a37-ba18-c40afd5f6426","resolution":{"observed_at":"2026-08-12T14:59:52.277763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T14:59:52.445807Z","title":"Randaugment: Practical automated data augmentation with a reduced search space","venue":null,"work_id":"5936951a-96e3-458f-96ad-f1e4b7629451","year":2020},"citing_paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T14:59:52.281615Z"},"links":{"citing_paper":"/paper/2411.14789"},"observation_digest":"sha256:085c6763e411c65feb6461270cfae03bc54a88b51cf768a17972de614435b3ba","observation_id":"d1580e7f-5c9a-4e48-959a-6db2de7f8d86","resolution":{"observed_at":"2026-08-12T14:59:52.452649Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.14789","last_updated":"2025-01-13T07:29:53Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T14:51:27.808690Z","submitted_at":"2024-11-22T08:17:46Z","title":"Simplifying CLIP: Unleashing the Power of Large-Scale Models on Consumer-level Computers"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2411.14789."}