{"as_of":"2026-08-14T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4ce31ce36314afa07dc9c5efd8e422ec993f4a3b680ee775aba6a31e033a2c36","coverage":[{"denominator":75,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":75,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T22:06:00.353383Z","state":"measured"},{"denominator":75,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":75,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.03871/citation-record","integrity":"/paper/2412.03871/integrity","json":"/paper/2412.03871/citation-record.json","paper":"/paper/2412.03871"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.090553Z","title":"Contrastive learning of medical visual representations from paired images and text,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.090553Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0887d203f0776ebdc0592434d61282545675bc409bf27541520bac5a10b11562","observation_id":"91946815-836d-4d45-a606-ecccd9ecf1eb","resolution":{"observed_at":"2026-08-11T22:06:00.090553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.095675Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.095675Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:70e081363bb3ba7d353a12260cf512755580545ee234f85405e88072fd563fb6","observation_id":"0aea3cd7-3cae-4250-8527-1152206ae3ee","resolution":{"observed_at":"2026-08-11T22:06:00.095675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:01.044959Z","title":"Vlmo: Unified vision-language pre-training with mixture-of-modality-experts,","venue":null,"work_id":"2de564c8-217b-4e7c-a6b8-2d7cbc2127ab","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.100573Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:2cf49b78f0b7fff3389bf3f943b6e57c7bf6f48238c5be13f9daef9ad4da8eca","observation_id":"bdbee442-6410-4f1b-8cf0-00cf44c82418","resolution":{"observed_at":"2026-08-11T22:06:01.049391Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.104843Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.104843Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:777a0a6220ec7168538ab056ffe1ea808bb124755fc155ff23003d03140edd57","observation_id":"ad94a0b6-cecf-40c4-8f46-45737d4c9243","resolution":{"observed_at":"2026-08-11T22:06:00.104843Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.07966","last_updated":"2020-01-23T08:03:27Z","snapshot_observed_at":"2026-08-13T04:05:30.435237Z","submitted_at":"2020-01-22T11:35:58Z","title":"ImageBERT: Cross-modal Pre-training with Large-scale Weak-supervised Image-Text Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.07966","snapshot_observed_at":"2026-08-11T22:06:00.109020Z","title":"Imagebert: Cross-modal pre-training with large-scale weak-supervised image-text data,","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.109020Z"},"links":{"cited_paper":"/paper/2001.07966","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:280b7f0a19800b36d1b0eb531f93a03860cb8407287035fdae12cc75ffe76ab9","observation_id":"ca36181f-c706-41ec-8116-a6c34923517b","resolution":{"observed_at":"2026-08-11T22:06:00.109020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:01.026096Z","title":"Reproducible scaling laws for contrastive language-image learning,","venue":null,"work_id":"434f92c0-0931-481d-9c9d-b90066af9444","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.113671Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:a979c753e3ba520ecac01854edcf1f0a9f11ffb1391f55ce7df9bd207fd4d1e1","observation_id":"e7c8122b-57ed-4cea-843a-0ee1e67cef29","resolution":{"observed_at":"2026-08-11T22:06:01.029833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.117928Z","title":"Scaling language- image pre-training via masking,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.117928Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:51bec2682b4b45a646782f8dc171ab955822e3405ce369f75d72160caff5144d","observation_id":"e5845aab-7b1b-41e8-a85d-afd68ca91055","resolution":{"observed_at":"2026-08-11T22:06:00.117928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:01.006257Z","title":"An inverse scaling law for clip training,","venue":null,"work_id":"1fc862fa-4467-4841-9777-bacf1fcb1351","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.121503Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:d18cdb73587f7e82f0223d111bc6c7479fc4535ca35214f42c6f49e25fe5ca5d","observation_id":"7ca70f1a-34ae-4d63-b0f3-1b88000e0dfe","resolution":{"observed_at":"2026-08-11T22:06:01.010717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.994616Z","title":"Supervision exists everywhere: A data efficient contrastive language-image pre-training paradigm,","venue":null,"work_id":"de4bc6f0-61d2-400a-ab1f-3de333b7c731","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.125049Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:efc2e996294067651935d713fb41c64ab5b640fff9aa79965ce47137860fcb41","observation_id":"8e6cf8b0-f751-40e8-b4c1-fb9357e61d26","resolution":{"observed_at":"2026-08-11T22:06:00.998963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.984025Z","title":"Too large; data reduction for vision-language pre-training,","venue":null,"work_id":"f9b6482d-0a59-4dc9-8142-de303cbd6b0a","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.130194Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ac608ff444ee159dff16c2660bd3b9d52ad92b1ca476d50339a7946248b83a59","observation_id":"6b4bbdfb-7b62-4e36-b559-e21730856a97","resolution":{"observed_at":"2026-08-11T22:06:00.988030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.973385Z","title":"Slip: Self-supervision meets language-image pre-training,","venue":null,"work_id":"b190563d-a68e-48da-841f-e3b1c9b6aa1d","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.134764Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:23b9ed6d9b922c8a8b5544301b19e7d4a7e23b796504bfa774ba6defc2e06bfa","observation_id":"3e8eba59-80c7-4892-879a-b7070098a7dc","resolution":{"observed_at":"2026-08-11T22:06:00.977198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.138881Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.138881Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:9caa5af1e384d2c224c98be261f7fa64dd32137a9455d1c5544f1550451ad9ef","observation_id":"e8482758-cd0d-4f74-9b3f-87a6816d2436","resolution":{"observed_at":"2026-08-11T22:06:00.138881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.142872Z","title":"Microsoft coco: Common objects in context,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.142872Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3d48d17d9503d6b558398e66aeb5cbc8c1469f844a17776e684113b5bed13d42","observation_id":"88ca24f7-999f-4835-b6c1-ac0fa8ddc1f8","resolution":{"observed_at":"2026-08-11T22:06:00.142872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.147060Z","title":"Conceptual captions: A cleaned, hypernymed, image alt-text dataset for automatic image cap- tioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.147060Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0d7b5f837a5cbcaaba52b6a81accb4eab8804093ae2252f85a247de33f935f4e","observation_id":"20bf84cc-3960-46ff-b846-cb466ae9e1dc","resolution":{"observed_at":"2026-08-11T22:06:00.147060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.935048Z","title":"Image as a foreign language: Beit pretraining for vision and vision-language tasks,","venue":null,"work_id":"a6ac169d-aa79-4c21-8f46-a81495488064","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.150607Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:e52d106ffae4d919f2c1a2e51ec968fcdc20c463e30a5ee69d8881c1e785d3f1","observation_id":"89f84f21-96d0-47ff-9ca2-a5aa5a72519c","resolution":{"observed_at":"2026-08-11T22:06:00.941175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.919620Z","title":"The crucial role of data collection in research: Techniques, challenges, and best practices,","venue":null,"work_id":"05e1a11c-87cc-447d-96ad-5e5774821dc9","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.154213Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:507c12eeb35a472046d9fb56ed3393fc682ebc406561e4237c057105e9f3f84a","observation_id":"236d816a-d82f-4d93-9908-254da5e0ef32","resolution":{"observed_at":"2026-08-11T22:06:00.924510Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.906472Z","title":"Tinyclip: Clip distillation via affinity mimicking and weight inheritance,","venue":null,"work_id":"9a134aed-ff77-4023-9314-6ede55be1719","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.159558Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f241aeae05bdebfd4bd0bde762466132ea701e6e9c2889d7f90e05671dfd2928","observation_id":"8288412d-19ea-4192-9e22-fd875dd932ea","resolution":{"observed_at":"2026-08-11T22:06:00.911260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.163378Z","title":"Clip-kd: An empirical study of clip model distillation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.163378Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:7b12554382b64a30295dd6603e5ca550939935d068521665ccee1bb922a20be9","observation_id":"512d4a61-f85b-45fc-934b-32f5880b9690","resolution":{"observed_at":"2026-08-11T22:06:00.163378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.167013Z","title":"Mobileclip: Fast image-text models through multi-modal reinforced training,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.167013Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:c1f46323d72c9eb2a4525f743fa329a31cdf871ef0a89eb7c8d8505f99f9869a","observation_id":"4d795658-3725-4daa-b2ad-9e4431d2f4cd","resolution":{"observed_at":"2026-08-11T22:06:00.167013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04145","last_updated":"2024-08-21T01:36:27Z","snapshot_observed_at":"2026-08-12T23:06:54.847488Z","submitted_at":"2024-08-08T01:12:21Z","title":"ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model","version":3},"cited_work":{"arxiv_id":"2408.04145","doi":null,"metadata_source":"pith","pith_arxiv_id":"2408.04145","snapshot_observed_at":"2026-08-11T22:06:00.464474Z","title":"ComKD-CLIP: Comprehensive Knowledge Distillation for Contrastive Language-Image Pre-traning Model","venue":"cs.CV","work_id":"d3f78f65-2eb5-4738-8352-decda4445a2a","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.170818Z"},"links":{"cited_paper":"/paper/2408.04145","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:2ae91976274afa14e3743f3e65ac29ed1168b029cac5f4c21cd39338c99bd516","observation_id":"abced0f7-245b-4d67-89f8-3de1d07393e5","resolution":{"observed_at":"2026-08-11T22:06:00.470348Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.09441","last_updated":"2024-12-16T11:26:26Z","snapshot_observed_at":"2026-08-12T23:01:57.917680Z","submitted_at":"2024-08-18T11:23:21Z","title":"CLIP-CID: Efficient CLIP Distillation via Cluster-Instance Discrimination","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.09441","snapshot_observed_at":"2026-08-11T22:06:00.174773Z","title":"Clip-cid: Efficient clip distillation via cluster-instance discrimination,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.174773Z"},"links":{"cited_paper":"/paper/2408.09441","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:063dd7bc79b107750e1ed52f2bc36beba2585f3d1f665632d84e9e5cdd4f5ec1","observation_id":"11b0426b-1949-4225-a587-212e3adc196a","resolution":{"observed_at":"2026-08-11T22:06:00.174773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.875844Z","title":"Module-wise adaptive distillation for multimodality foun- dation models,","venue":null,"work_id":"d15781a2-eab9-42c8-9eab-916552d91b5f","year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.179242Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:e6c3597112f2a3a2025eb0202e0ee9eefaa4d17ea92b9aea4a9d17e031bbf4a4","observation_id":"98bb1143-be61-4147-842b-fc4dcc342547","resolution":{"observed_at":"2026-08-11T22:06:00.880132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.862702Z","title":"Self-supervised co-training for video representation learning,","venue":null,"work_id":"3fd8dae9-b306-4d46-b581-8bcbf9d45c70","year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.182919Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:c21ab204f06085dab888b194269c0a11be443ee2f5a5fa6f8238502c57693437","observation_id":"64a7479b-8a93-41b1-b089-879819650dfe","resolution":{"observed_at":"2026-08-11T22:06:00.867734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.849739Z","title":"Improving generalization via scalable neighborhood component analysis,","venue":null,"work_id":"c51e03b4-0018-4d59-940c-a4d16b5d6d27","year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.186788Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3fe81baa6344f2509d2ddf3871a3e236295cd4ae7d5f71e23384218d10459304","observation_id":"a58589fe-c8c8-4090-a7e6-35ce51f73929","resolution":{"observed_at":"2026-08-11T22:06:00.854101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.190524Z","title":"With a little help from my friends: Nearest-neighbor contrastive learning of visual representations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.190524Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3682c55f1ba74dbe42736eb45d36cf50d0daf41c426218dcb72255b6f6bc9973","observation_id":"94da781f-6637-4cea-8bb5-9e987f1f8841","resolution":{"observed_at":"2026-08-11T22:06:00.190524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.828683Z","title":"Promoting semantic connectivity: Dual nearest neighbors contrastive learning for unsupervised domain generalization,","venue":null,"work_id":"f8f6aa04-5ed1-4924-88c8-b340110e465e","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.193769Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f0c065188da72cc455a96032fea1077c78c7bca220bf091933996c00d276a2e2","observation_id":"1190b91c-0203-492d-ad08-ee158f2b05a1","resolution":{"observed_at":"2026-08-11T22:06:00.833909Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.197171Z","title":"Imagenet: A large-scale hierarchical image database,","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.197171Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:6417606153ed59bbf996a7920f4bf786b02ac267c26fbd2dd2f52e5e1c61552c","observation_id":"026e746f-b4b5-41f5-aeef-8fa9ecbd9c5b","resolution":{"observed_at":"2026-08-11T22:06:00.197171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.200851Z","title":"From image descriptions to visual denotations: New similarity metrics for semantic inference over event descriptions,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.200851Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:c7a7141660f1dd56daf47d47f477375543e4fcfe0d59921d4ffa83cba79dc80b","observation_id":"c06e4be7-ac28-48c5-8350-0831648a41c9","resolution":{"observed_at":"2026-08-11T22:06:00.200851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.204377Z","title":"Vision-language models for vision tasks: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.204377Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ae6d5eeb028a87326464593bd561ab4158984a2ff8cce20df5606f64844466e7","observation_id":"4a203864-f0f4-446b-8b9f-f7c74ca00559","resolution":{"observed_at":"2026-08-11T22:06:00.204377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.10936","last_updated":"2022-07-16T01:27:59Z","snapshot_observed_at":"2026-08-13T16:38:29.058109Z","submitted_at":"2022-02-18T15:15:46Z","title":"A Survey of Vision-Language Pre-Trained Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.10936","snapshot_observed_at":"2026-08-11T22:06:00.207800Z","title":"A survey of vision-language pre-trained models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.207800Z"},"links":{"cited_paper":"/paper/2202.10936","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3ecb3968fe467f04ed31e643628b037192ee9dc989de0c3ee9f0de9b991fcce4","observation_id":"d1db178b-18c5-4aab-af74-5a9d5e858327","resolution":{"observed_at":"2026-08-11T22:06:00.207800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.211525Z","title":"Vlp: A survey on vision-language pre-training,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.211525Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:71846f7b4b5073dee2a79e8e4d0ca60d7bce8e977ed483714b8009c2807000ab","observation_id":"f8bb8222-28f2-4be0-a75b-cea192dc845b","resolution":{"observed_at":"2026-08-11T22:06:00.211525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.780035Z","title":"Self- supervised learning of visual features through embedding images into text topic spaces,","venue":null,"work_id":"5426d911-8105-4272-b2b8-8392cedd45ad","year":2017},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.214468Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:6a9f7bd58a8566b1d6d055b4427f59548176c8a8b1aa75e8b8448fd2d3e8e8ce","observation_id":"90cd535b-2824-4fe1-ad29-2685a4b6ed02","resolution":{"observed_at":"2026-08-11T22:06:00.784451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.767335Z","title":"Beyond instance-level image retrieval: Lever- aging captions to learn a global visual representation for semantic retrieval,","venue":null,"work_id":"67a4d7d1-d63f-43bc-a487-4d11283c5cd4","year":2017},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.217478Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:b0260c633c4d8963cd1c3317e0d37a9be578700bba4cd11a6fbb2f4f55630793","observation_id":"ac14d9e5-3188-4772-9bff-50f865e083a9","resolution":{"observed_at":"2026-08-11T22:06:00.771795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.754130Z","title":"Learning visual n-grams from web data,","venue":null,"work_id":"380e4150-1d02-45e9-8bf4-c740c46fe6ef","year":2017},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.220250Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:4de244a077d414a2ef4ae1ee9ad53e6279515d0e24726a25ea668e95a98b806c","observation_id":"2b30d2c5-aa1d-4108-b940-11841b3b8923","resolution":{"observed_at":"2026-08-11T22:06:00.759054Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.223160Z","title":"Virtex: Learning visual representations from textual annotations,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.223160Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:43929c3987c550f178072615be431dd1c1dc0e51e7598053efc72eb2920cee54","observation_id":"0b009b12-0821-4b51-aea5-1e57736515ff","resolution":{"observed_at":"2026-08-11T22:06:00.223160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.226288Z","title":"Learning visual representa- tions with caption annotations,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.226288Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:5f4875d5ab62153e2b16bf21291070d5669faec89d7f93f2f2ec5335824b907e","observation_id":"7f330f13-f532-4857-a9cc-48442ff3b788","resolution":{"observed_at":"2026-08-11T22:06:00.226288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.720894Z","title":"Combined scaling for zero-shot transfer learning,","venue":null,"work_id":"341dadcc-965c-4924-aa1c-5fcbe8b9b372","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.229123Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ff21f5de619ebacd759726a80d79d8d67042ae31eeb68b4577633593107263d4","observation_id":"925d989d-082b-43e3-b996-21cc8e9798e9","resolution":{"observed_at":"2026-08-11T22:06:00.724957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.711013Z","title":"SimVLM: Simple visual language model pretraining with weak supervision,","venue":null,"work_id":"4064524b-9a26-4cd1-b7b4-803e60346f96","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.232081Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:e453c1db6806f38610c4f0ca76be625451d10b3fbb43a904950c60e8c43a7a6e","observation_id":"156132af-75b2-4825-9262-f41f3e8c6ad6","resolution":{"observed_at":"2026-08-11T22:06:00.714698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.11432","last_updated":"2021-11-22T18:59:55Z","snapshot_observed_at":"2026-07-06T12:11:02.119174Z","submitted_at":"2021-11-22T18:59:55Z","title":"Florence: A New Foundation Model for Computer Vision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.11432","snapshot_observed_at":"2026-08-11T22:06:00.234692Z","title":"Florence: A new foundation model for computer vision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.234692Z"},"links":{"cited_paper":"/paper/2111.11432","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:cebc9316fcd3879ece97315ac4954401f5e93c6be4d511216f2fd888aef359fd","observation_id":"b52c001c-90ff-4127-9a22-83093896cc27","resolution":{"observed_at":"2026-08-11T22:06:00.234692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.701076Z","title":"Lit: Zero-shot transfer with locked-image text tuning,","venue":null,"work_id":"ae3a88bd-bf23-4bb4-9f48-ed5f4154d2f9","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.238602Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:335e4f488d360863e80f2d35871b2cd5fc998fcd49335b76c26474787af1e29e","observation_id":"063d9e71-4045-4488-9ea2-588180f339e7","resolution":{"observed_at":"2026-08-11T22:06:00.704730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.690047Z","title":"Compressing visual-linguistic model via knowledge distillation,","venue":null,"work_id":"0a32b5ad-84a7-49c7-bd80-1bf59ab023a7","year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.241819Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:969076cbf30894d96a064974149edd08ec3663873919f75308a752d302ff93f2","observation_id":"a5d540bb-1243-4d9e-bab9-45b2237b970a","resolution":{"observed_at":"2026-08-11T22:06:00.693660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.679835Z","title":"Distilling large vision-language model with out-of-distribution generalizability,","venue":null,"work_id":"d26de104-55fd-4444-beaf-ab79e92b0181","year":2023},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.245036Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3f5229c0814a2bc5b9df90240b822b0d9f1a1725e9dc9ab9c518006ad6857849","observation_id":"3ca00690-42f1-4dff-b713-28007b1779d7","resolution":{"observed_at":"2026-08-11T22:06:00.683490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.10496","last_updated":"2022-04-28T17:43:36Z","snapshot_observed_at":"2026-08-13T15:57:55.536341Z","submitted_at":"2022-04-22T04:41:04Z","title":"Multimodal Adaptive Distillation for Leveraging Unimodal Encoders for Vision-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.10496","snapshot_observed_at":"2026-08-11T22:06:00.248566Z","title":"Multimodal adaptive distilla- tion for leveraging unimodal encoders for vision-language tasks,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.248566Z"},"links":{"cited_paper":"/paper/2204.10496","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:a55d67d94fd8e2b5e79d4b37d55e66f6b3085e894c65cdc457ca0e0afc9d5225","observation_id":"d168bf67-5684-46a2-901a-3d40d0ec970d","resolution":{"observed_at":"2026-08-11T22:06:00.248566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1807.03748","last_updated":"2019-01-22T18:47:12Z","snapshot_observed_at":"2026-07-06T06:49:24.960992Z","submitted_at":"2018-07-10T16:52:11Z","title":"Representation Learning with Contrastive Predictive Coding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1807.03748","snapshot_observed_at":"2026-08-11T22:06:00.252477Z","title":"Representation learning with contrastive predictive coding,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.252477Z"},"links":{"cited_paper":"/paper/1807.03748","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:001be2dde08ecb0163accd85e139b9077ebad948031996e926977edeebf22121","observation_id":"96d6f81d-acd0-499d-a518-27fd20d71bc7","resolution":{"observed_at":"2026-08-11T22:06:00.252477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.256071Z","title":"Pytorch: An imperative style, high-performance deep learning library,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.256071Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:d20f1b537a8f5b29df265f76d725515a37cd182ec99434073a2def3062fa12eb","observation_id":"38f597db-d92e-4f1d-8958-428760d598e7","resolution":{"observed_at":"2026-08-11T22:06:00.256071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.259290Z","title":"Pytorch image models,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.259290Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:b3535221141aa3b88eb398671dd6c2c59118aaf306a8b99bb6f4c3ef454e0f93","observation_id":"f4209112-e2f7-4097-bd4b-46c69d80807a","resolution":{"observed_at":"2026-08-11T22:06:00.259290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.657973Z","title":"MobileBERT: a compact task-agnostic BERT for resource-limited devices,","venue":null,"work_id":"9923432c-648a-4a72-9334-688122780e44","year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.262663Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0055b181aafd9a781d1439cd85b2a744a25ebd0eb3e4a3796e1565bfa8579afc","observation_id":"3a61defe-dde8-4b7c-ba72-7e3c30db0a81","resolution":{"observed_at":"2026-08-11T22:06:00.661894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.266138Z","title":"A convnet for the 2020s,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.266138Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:ce14b74e71c905668063532849cea19751cf8e1e3b7543d44a3c678be65d2c63","observation_id":"6e400ef1-71af-4e03-a2d6-8db114ad7506","resolution":{"observed_at":"2026-08-11T22:06:00.266138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10518","last_updated":"2024-09-29T21:58:22Z","snapshot_observed_at":"2026-08-13T04:04:42.783921Z","submitted_at":"2024-04-16T12:41:25Z","title":"MobileNetV4 -- Universal Models for the Mobile Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10518","snapshot_observed_at":"2026-08-11T22:06:00.269384Z","title":"Mobilenetv4-universal models for the mobile ecosystem,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.269384Z"},"links":{"cited_paper":"/paper/2404.10518","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:1fccc47faf0107e588a9fff0ecd8ca789aea161634e526100347d589a850d625","observation_id":"1fb58ed0-7f95-4fb1-af0a-cd1c801b0c5e","resolution":{"observed_at":"2026-08-11T22:06:00.269384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.642083Z","title":"Big transfer (bit): General visual representation learning,","venue":null,"work_id":"77008822-0214-41f1-9ce8-96f78deb093b","year":2020},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.273076Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:7e1d12598e5ddfb1ec517f6a2fcec0eedba6d81998fd481e55e8045e52252253","observation_id":"b26d086a-b239-4fbb-a27d-2f4f475085da","resolution":{"observed_at":"2026-08-11T22:06:00.645346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.276429Z","title":"Identity mappings in deep residual networks,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.276429Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:3b9840066836ffdd372a29d8e6779f15aa98eb69395749eac2c05468d92c5773","observation_id":"01984534-8d08-4e14-a204-b54f5b76e920","resolution":{"observed_at":"2026-08-11T22:06:00.276429Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.279965Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.279965Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:fa13c5023179eef2436e9ded7b4fef915ab623a8d0c152a2e1655871a59d00ed","observation_id":"53c711ba-8155-49c4-9ca8-549a181a1cf7","resolution":{"observed_at":"2026-08-11T22:06:00.279965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.283293Z","title":"Decoupled weight decay regularization,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.283293Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:e9f85455bc574d51b541e3a467023e5044ce9a091fa00f2b212278021730fc4a","observation_id":"9528bc2e-a8cb-414b-99a2-83d8f1c54636","resolution":{"observed_at":"2026-08-11T22:06:00.283293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.615075Z","title":"Algorithm 799: revolve: an implementa- tion of checkpointing for the reverse or adjoint mode of computational differentiation,","venue":null,"work_id":"08ec4031-f079-4101-ae7c-a07436eabf4d","year":2000},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.286716Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:5ce35b92edde903073107cc10b67114f6d940cd576dc2c83f2c8f946a2e4d1b6","observation_id":"037f5969-2b5b-4763-bf50-9e497fe88522","resolution":{"observed_at":"2026-08-11T22:06:00.619079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1604.06174","last_updated":"2016-04-22T19:21:36Z","snapshot_observed_at":"2026-08-14T02:59:02.136845Z","submitted_at":"2016-04-21T04:15:27Z","title":"Training Deep Nets with Sublinear Memory Cost","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1604.06174","snapshot_observed_at":"2026-08-11T22:06:00.289929Z","title":"Training deep nets with sublinear memory cost,","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.289929Z"},"links":{"cited_paper":"/paper/1604.06174","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:d62c6afd943213a259289c61135d3d3013e50598a3ba259e4ddbec3e9da37443","observation_id":"49120462-847a-42d0-8b3d-9e0d85a1b312","resolution":{"observed_at":"2026-08-11T22:06:00.289929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.604976Z","title":"Mixed precision training,","venue":null,"work_id":"b77bd294-a9ea-4b72-9e59-3b3340583144","year":2018},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.293603Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:c1905dc307cd50d6689698202a7836fa34e8309209736c12dfd05f56a85cfcae","observation_id":"dd24f8c8-fb05-4cb6-b22d-7cc28335a625","resolution":{"observed_at":"2026-08-11T22:06:00.608386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.296954Z","title":"An analysis of single-layer networks in unsupervised feature learning,","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.296954Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:526967d43e0e8f8f91a7b454181339307f034e7a91bd594d34cf728868512d66","observation_id":"cc95b177-27c6-41dc-b72e-b3cf8d6e0854","resolution":{"observed_at":"2026-08-11T22:06:00.296954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.587822Z","title":"Learning multiple layers of features from tiny images,","venue":null,"work_id":"e9aa0f0c-753e-4f8a-a933-a3f166dfc88a","year":2009},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.300463Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:195125802e018a6f15faf468dd33a40fc71d8f4c25616f8eecf8030c83345165","observation_id":"c7bee03e-4e57-4228-983c-ec90e8a1a218","resolution":{"observed_at":"2026-08-11T22:06:00.591862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.577665Z","title":"Human action recognition by learning bases of action attributes and 14 parts,","venue":null,"work_id":"7672835c-ce2a-4351-a8b6-472feb7f3841","year":2011},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.303985Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:8ecbd4540771264a05ff4278c4cceef13272bc506376690eaaf2dca75e708ad5","observation_id":"fd03d16d-6366-4ec8-aa8f-172ff09cee95","resolution":{"observed_at":"2026-08-11T22:06:00.581109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.567703Z","title":"Do imagenet clas- sifiers generalize to imagenet?","venue":null,"work_id":"1854c619-8d07-4379-bcfb-12383071c5b8","year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.307645Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:d5b7a4106c86d600a86ae12776d8f2cf54f947719a813473a8a25c5d6304fba1","observation_id":"a80240a3-fbb7-4a3f-93cf-be9ac967d8a6","resolution":{"observed_at":"2026-08-11T22:06:00.571263Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.310953Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.310953Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:0fcc1fa5ec36056915ab540dd8e87439d6c3b6e5309950e96869cc45891b8f66","observation_id":"aefd8b45-d5df-49b4-a8e9-d8c3b99f703a","resolution":{"observed_at":"2026-08-11T22:06:00.310953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.314256Z","title":"Natural adversarial examples,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.314256Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:64fed08d0c836385c9231b0cea45655da2af8e0a0b9805f188cbcedb2c298f80","observation_id":"539b9788-7af3-40cf-b5e9-16ba2ea8a00c","resolution":{"observed_at":"2026-08-11T22:06:00.314256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.546178Z","title":"Learning robust global representations by penalizing local predictive power,","venue":null,"work_id":"2169f1e9-3c74-4a03-bfe4-4b4c284e7ba5","year":2019},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.317590Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:92eaf6b259fbb35f889ae510d83b1e22951591967befdb5c5cfac4d1b1a25dc6","observation_id":"3e797959-6474-4019-ab3c-9e05e8030a02","resolution":{"observed_at":"2026-08-11T22:06:00.549967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.320891Z","title":"Cats and dogs,","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.320891Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:305bda8bef25a650a0fe0edca4674c655189f54bbd612b7eee438edf8cbe49aa","observation_id":"f2ac2cc0-e8e2-44a5-81a3-e69ae3f039d5","resolution":{"observed_at":"2026-08-11T22:06:00.320891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.323621Z","title":"Learning generative visual models from few training examples: An incremental bayesian approach tested on 101 object categories,","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.323621Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:c23f195373215b89a398c504af1e771cea2377fa349b42b1d19141fd41bc2e89","observation_id":"a1449af8-2a7c-4dec-87dd-f55bcb7359df","resolution":{"observed_at":"2026-08-11T22:06:00.323621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.326785Z","title":"Automated flower classification over a large number of classes,","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.326785Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:7208cf25db3a4b98823eb6ff1974dce3e08de2857391fb9b947727a4851ffa95","observation_id":"29563316-e331-4aa3-80d8-a946108cc0d1","resolution":{"observed_at":"2026-08-11T22:06:00.326785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-08-12T17:35:23.022229Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-08-11T22:06:00.329530Z","title":"Fine- grained visual classification of aircraft,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.329530Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:aa06f289ccbe40039402095f3e4348d34b7527183137d41db610b29fbd0793fd","observation_id":"098783a8-9ee8-4094-be52-00cd110e5e21","resolution":{"observed_at":"2026-08-11T22:06:00.329530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.333125Z","title":"Food-101–mining discriminative components with random forests,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.333125Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:f32d557b03e5e3e57174707848d3f00489241793370378335207e8ca2d59779a","observation_id":"2ba57d51-3a69-41aa-8b41-9e61daa0cb44","resolution":{"observed_at":"2026-08-11T22:06:00.333125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.335701Z","title":"Describing textures in the wild,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.335701Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:5edce460a4331bcfa723197c065f17a89748940a4765237d5f8256a3d6241bfd","observation_id":"c08a64fc-c9f0-4911-a6e4-b56e013a7d3f","resolution":{"observed_at":"2026-08-11T22:06:00.335701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.338608Z","title":"Sun database: Large-scale scene recognition from abbey to zoo,","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.338608Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:bf991043fb843f970826ed2508985ee7219b0b7b101d967c5b10ae651561e525","observation_id":"52fe8b59-0b0e-4a61-a699-08119d0c2d7e","resolution":{"observed_at":"2026-08-11T22:06:00.338608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.341399Z","title":"Collecting a large-scale dataset of fine-grained cars,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.341399Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:075f99fd680b3e4381228f5d29a65b9b8d9a4c636e2fa27bf9a650aa0c70213f","observation_id":"4cc371d4-12f0-41b8-b9c9-5bb66dc9ef3f","resolution":{"observed_at":"2026-08-11T22:06:00.341399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.344080Z","title":"3d object representations for fine-grained categorization,","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.344080Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:27d7c133f1bf81450683da1e69d8109c3e638337d5609d2fa50a1b40620f7b44","observation_id":"de58c476-3a39-4ef7-a0a4-50997fcf47cc","resolution":{"observed_at":"2026-08-11T22:06:00.344080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-11T22:06:00.347067Z","title":"Adam: A method for stochastic optimization,","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.347067Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:b503eb10fc3e41f5f3c6c83add22e57ddd3112157e38a5c6e2a77134ce01795e","observation_id":"51ec20a6-c923-4b42-b048-a8bdd9703bae","resolution":{"observed_at":"2026-08-11T22:06:00.347067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.350128Z","title":"Knowledge distillation: A good teacher is patient and consistent,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.350128Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:712523180bf41069ef401593e3758315f3151d97f26eda68d25e9669bc120944","observation_id":"470a26e8-36c3-46ed-a93a-cf747da79d27","resolution":{"observed_at":"2026-08-11T22:06:00.350128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T22:06:00.486711Z","title":"The efficiency misnomer,","venue":null,"work_id":"440d14f9-0090-4e2e-ae6a-66f7c0fe91ed","year":2022},"citing_paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-11T22:06:00.353383Z"},"links":{"citing_paper":"/paper/2412.03871"},"observation_digest":"sha256:5df909be68a588bed45e909015317d620b95761653fa3d734b8d568c665e6fac","observation_id":"c0a7247d-e83d-4c79-ab06-b97a3876c7fa","resolution":{"observed_at":"2026-08-11T22:06:00.490177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2412.03871","last_updated":"2025-03-19T02:30:05Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T04:05:06.374843Z","submitted_at":"2024-12-05T04:58:28Z","title":"CLIP-PING: Boosting Lightweight Vision-Language Models with Proximus Intrinsic Neighbors Guidance"},"reference_resolution":{"displayed":75,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":30},"total_outbound_references":75},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 75 of 75 outbound references and 0 inbound Pith citation observations for arXiv:2412.03871."}