{"as_of":"2026-08-10T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:e92a6852f96209775d313f0f2b593ee6bc324e45d5e4c348a0ece164cc898aa7","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:46:45.600246Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22431/citation-record","integrity":"/paper/2507.22431/integrity","json":"/paper/2507.22431/citation-record.json","paper":"/paper/2507.22431"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-06T11:46:45.257026Z","title":"Are we on the right way for evaluating large vision-language models? arXiv preprint arXiv:2403.20330,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.257026Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:3117e90f7873088c36fb317fa2cfcfd24cab8d2c4c7cef58ad587c0a321fc131","observation_id":"8687808d-6b90-469b-859c-9db72dba25ab","resolution":{"observed_at":"2026-08-06T11:46:45.257026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.719768Z","title":"Internvl: Scaling up vision foundation mod- els and aligning for generic visual-linguistic tasks","venue":null,"work_id":"3933ea0d-a87e-4519-a9fc-d653a643f2f9","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.264665Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:b0f88d7718f9a027e3bf99908932038743f187f4f719b698cc6ed2d26ce7353a","observation_id":"fdb97316-3ec5-4106-9d2a-27cd89f67a64","resolution":{"observed_at":"2026-08-06T11:46:46.727507Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.690379Z","title":"Internlm-xcomposer2: Mastering free-form text- image composition and comprehension in vision-language large model, 2024","venue":null,"work_id":"d3d8d11d-1ec7-435f-9729-c2e643ec33b6","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.275197Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:1f3b4fa8b768a618219ac9438575ade39b24a07225d27542b69622f4e6e978b4","observation_id":"e0755a2a-6891-4009-a98a-81960f9c5784","resolution":{"observed_at":"2026-08-06T11:46:46.697555Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.669842Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":"3157eca6-1ea7-4366-808a-b4f1e071e8ec","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.285435Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:2eb9d3aa9aa61c753ded93d8b264775b2e6eb4849dbdd3578a1ca8b3e5e859a2","observation_id":"0313582b-5d45-43cb-9d05-8a60e610ddbd","resolution":{"observed_at":"2026-08-06T11:46:46.677311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.651349Z","title":"Improving clip training with language rewrites","venue":null,"work_id":"149b3e6e-656f-4010-93d6-74c7e9f00111","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.293013Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:a7f91ef1dc0e444d31ce35553a991eb01e52117d73c212a49e79adc56dd2d00f","observation_id":"da9deaac-5bd3-4c4b-9d39-8fc13fc2bc11","resolution":{"observed_at":"2026-08-06T11:46:46.656336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.633179Z","title":"Data fil- tering networks, 2023","venue":null,"work_id":"26d331c8-a977-476f-bad0-a08f86c8af21","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.306448Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:6c24a88c5a101de85c44bb8718359a2b5fde28cf7c0ad1e1e377d36c67276fc6","observation_id":"8494b625-6a4d-4b55-ab54-5a42840d6363","resolution":{"observed_at":"2026-08-06T11:46:46.638350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.606724Z","title":"Eva: Exploring the limits of masked visual representa- tion learning at scale","venue":null,"work_id":"2f42ce71-3212-4f9e-8554-7827ca1744ea","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.313820Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:f074fb0fba365eca8cdde133258e9ce2de23eb986c905b2859e97ffd9085bd82","observation_id":"039d2dd5-6b27-4bc1-963c-aab84da425aa","resolution":{"observed_at":"2026-08-06T11:46:46.616900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.580676Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":"b5d9780a-c759-4ffa-9053-74515d39cf84","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.325074Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:f8e99a633f6d9d7223cbf9722bf4bce72bf3cbd9f473c8b4de358dc60b63fb0e","observation_id":"67bff9d6-c2f2-466e-b1f4-172f4223377b","resolution":{"observed_at":"2026-08-06T11:46:46.588004Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.559565Z","title":"Datacomp: In search of the next generation of multimodal datasets, 2023","venue":null,"work_id":"ec30f154-0b98-4e37-9af7-7382f545c954","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.332237Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:a87475993ba65f599ce1d2aa5e9f4b2ebb58e8a2dd15692d15a0cf28e16d0d2f","observation_id":"08175ae1-0b0d-48a8-a002-ca6b7aa2389d","resolution":{"observed_at":"2026-08-06T11:46:46.567545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.540469Z","title":"Classification done right for vision-language pre- training","venue":null,"work_id":"f275c228-60e4-40a1-9f1b-a1ee5f247909","year":2025},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.339790Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:901d73236af31658bbd9f16923e0757191f1af66ffc19b6c0246534fcc11d5ea","observation_id":"7262f8be-d511-49d4-9f5f-7e83a661c015","resolution":{"observed_at":"2026-08-06T11:46:46.547919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T11:46:45.348101Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.348101Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:2edb52a6eb42f9ad2dae3e53a03b04c729f4dc6b525177f4b88f5eb40fc30aa6","observation_id":"911d6cae-6135-43ee-abee-333269196a7d","resolution":{"observed_at":"2026-08-06T11:46:45.348101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.523288Z","title":"Open- clip, 2021","venue":null,"work_id":"7fe9c39a-3054-445d-87dd-949daf5482d3","year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.362242Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:fb490bb611bd59e4532cd1853cbe2fdf22fecbbcdaa02d14fa21f3bd3fa21e33","observation_id":"f54851e5-6dbb-4eb5-a7ed-24e0d60f14d3","resolution":{"observed_at":"2026-08-06T11:46:46.528791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.501057Z","title":"Veclip: Improving clip training via visual-enriched captions,","venue":null,"work_id":"548efb01-12bb-4157-a7ff-3819fb3315ac","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.368122Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:9a7fb222213eaa0dabe55dc59c1b3e838ebaa699504cafd4db6377cea2631f73","observation_id":"f0fba9fa-74f1-4a7d-b16e-d53deb8a3785","resolution":{"observed_at":"2026-08-06T11:46:46.508293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.481359Z","title":"Seed-bench: Benchmarking multimodal llms with generative comprehension, 2023","venue":null,"work_id":"0744e39a-a098-4ac1-a446-db86bb6afbbf","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.375675Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:e15ca39d4cdfa69e093fb0e6080a3538a61a25d728ba51f2b71f3a1a034c4b35","observation_id":"372feb51-e920-4792-a9ab-c9d3bc5b0ee6","resolution":{"observed_at":"2026-08-06T11:46:46.486667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.444796Z","title":"Grounded language-image pre-training","venue":null,"work_id":"e398004e-64b5-46dc-8c02-9b581e3365c6","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.387890Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:1cea9f18d26c2e76c15ec16103d3aecc004a80d2fe21bf708850b89f779682a6","observation_id":"77ed29c0-809d-412b-8fff-de2ece218112","resolution":{"observed_at":"2026-08-06T11:46:46.457246Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.423475Z","title":"Clipa-v2: Scaling clip training with 81.17, 11","venue":null,"work_id":"b962b191-5a2c-4c12-a544-3cce3aa452f7","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.395048Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:b9d4ecd9360b3f8705babb965b0d14114cbb21de476b351bbb107e6de52c8aed","observation_id":"3fe468b9-21f8-477f-980b-b93aadf25fa3","resolution":{"observed_at":"2026-08-06T11:46:46.428986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08478","last_updated":"2024-06-18T11:47:26Z","snapshot_observed_at":"2026-07-06T18:29:49.284504Z","submitted_at":"2024-06-12T17:59:07Z","title":"What If We Recaption Billions of Web Images with LLaMA-3?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08478","snapshot_observed_at":"2026-08-06T11:46:45.400816Z","title":"What if we recaption billions of web images with llama-3? arXiv preprint arXiv:2406.08478,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.400816Z"},"links":{"cited_paper":"/paper/2406.08478","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:eb1a1240273aa8a43ea54b5c147055f1ef7efd5af8669adbbdde4886b55f3725","observation_id":"bca85c64-9114-4285-a012-c084a8a858ba","resolution":{"observed_at":"2026-08-06T11:46:45.400816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.405302Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":"afbe6afa-7d03-41ca-9bf1-6600a7fb5193","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.415558Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:ef9bb1430c8b6a82de313c666d9b9dc2f6252115cfec30f36e3d7a6ab24be423","observation_id":"12443c6b-bad7-4196-ab35-6c714c0a0a5b","resolution":{"observed_at":"2026-08-06T11:46:46.410742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.420691Z","title":"Visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.420691Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:49f1f3333e8ac0539213e6b1903c0a67fdb4b54decfd5850fed5a83c5713dc14","observation_id":"cd5a54de-8e88-4196-9e92-ccfe55968d28","resolution":{"observed_at":"2026-08-06T11:46:45.420691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.366721Z","title":"Llava-next: Im- proved reasoning, ocr, and world knowledge, 2024","venue":null,"work_id":"9e185563-9d0e-4290-a35c-6491f305c01e","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.427199Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:41d3a87b022483b718f0aa4fe63eedbc45ab3afcf5861a67febc3a3d243e33fe","observation_id":"60a38ff6-e757-4a52-91d5-6debf7111c78","resolution":{"observed_at":"2026-08-06T11:46:46.376042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.432094Z","title":"Mmbench: Is your multi-modal model an all-around player?, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.432094Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:1f25bc1523ef0c7ea57dce5a26a371bec3a4f9824b5f3bb846cc0d9ca99077b1","observation_id":"ab674b3e-c7a2-46c9-84cb-9726f7a5cfc4","resolution":{"observed_at":"2026-08-06T11:46:45.432094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.326548Z","title":"Slip: Self-supervision meets language-image pre- training","venue":null,"work_id":"a819a1c0-ebfe-48f9-8575-f678ebf03fbe","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.440608Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:e44719649d5bf21ef4bd1a6828fec44c4b0e74f89bef7728d1956b19a4e7fbcf","observation_id":"bae38e45-a8ab-44c0-866e-28cd93456e8a","resolution":{"observed_at":"2026-08-06T11:46:46.331626Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.302765Z","title":"Improving multimodal datasets with image captioning","venue":null,"work_id":"b44d4ace-7199-4199-93ec-eb2851159fe9","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.447199Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:4e4349d52ef4b04c850187371f5d66b7d614e27b560e41ff1ab032560bca3373","observation_id":"51154b03-b426-4fd2-bc89-38e3bcd0ef82","resolution":{"observed_at":"2026-08-06T11:46:46.308562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.273403Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sastry, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":"2eed096e-e88d-40fd-8de1-9f431ed35591","year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.453397Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:bef087c82b504c48c6d46119c8b5ecd2fbd46928740e471983468c4f6d566082","observation_id":"1a6f594c-487c-42a3-be44-5dbf127470de","resolution":{"observed_at":"2026-08-06T11:46:46.282647Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.459856Z","title":"Denseclip: Language-guided dense prediction with context- aware prompting","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.459856Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:bbfb6c463198f3e01ca3a91ad2211d0e92ade8667386180a99e0d7a039808654","observation_id":"21558c4b-2ba8-43ad-a5c6-19f6ce3b1c71","resolution":{"observed_at":"2026-08-06T11:46:45.459856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.230630Z","title":"Fusecap: Leveraging large language mod- els for enriched fused image captions","venue":null,"work_id":"09dbaf15-25ee-4302-84c5-f214dd470354","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.465588Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:8b22aea8f952a0a6ba0fa86e1d77118565d4fd4b6299e0441c1c26dc6f13da6c","observation_id":"d1b1a601-d1dd-4e87-a7f7-aaddb8730b77","resolution":{"observed_at":"2026-08-06T11:46:46.237591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-06T11:46:45.476634Z","title":"Laion-400m: Open dataset of clip-filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.476634Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:10c0b9ba1fc68c71af211ab62576728edc2f2d3a1f481935fadaab0432183708","observation_id":"972fd9d1-1252-4f40-af1c-da919df8a99f","resolution":{"observed_at":"2026-08-06T11:46:45.476634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.207340Z","title":"Laion-5b: An open large-scale dataset for training next generation image-text models","venue":null,"work_id":"b0d7d3e1-bfe9-4f3a-9cc4-f0a3aa4c3c83","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.483145Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:8a91a1920f0a301e843f2a0561440aefcb3df213277c07427f798bf5fc37b24d","observation_id":"3d5e3a2d-5cc3-4ce9-839f-03e51b64573c","resolution":{"observed_at":"2026-08-06T11:46:46.214046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T11:46:45.488144Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.488144Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:6d595f9c1373051ee8a5b630e512ef80d11db232c4f49cb0cc079640325c4be1","observation_id":"41e5be2f-a1ec-40fe-b8be-6310f94a4b85","resolution":{"observed_at":"2026-08-06T11:46:45.488144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-06T11:46:45.494374Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of con- text","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.494374Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:e9420d2b6f35ed64e2caee6d23b90d27cd075467f6af80024d04681f0ec313f6","observation_id":"b64dc236-7bd4-4c47-b9e5-56161efecd1a","resolution":{"observed_at":"2026-08-06T11:46:45.494374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-06T11:46:45.499725Z","title":"Siglip 2: Multilingual vision-language en- coders with improved semantic understanding, localization, and dense features","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.499725Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:ce0213c13e8421e86cf3f72f2c359f64c1ce12584782a7c8b8d44974abe0dd18","observation_id":"2e124188-8a4c-472c-8dab-0138ecb71694","resolution":{"observed_at":"2026-08-06T11:46:45.499725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.178905Z","title":"Locca: Vi- sual pretraining with location-aware captioners","venue":null,"work_id":"7e55ad1c-c231-4a38-882a-58bf4763ce3c","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.505688Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:b6b747f29560a0365457fa53a38f498ab6b4b3ce73a18e30c9a5fb183448f274","observation_id":"54248436-f71d-4947-a733-fae403771130","resolution":{"observed_at":"2026-08-06T11:46:46.184807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T11:46:45.512014Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.512014Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:07e5ebff2b16f8d52480935c79c1a191a55b19754ca28481ccb5c503a5ec9ab4","observation_id":"1fbfab01-1955-4999-a42c-e42b7267011d","resolution":{"observed_at":"2026-08-06T11:46:45.512014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.14084","last_updated":"2021-10-01T15:13:27Z","snapshot_observed_at":"2026-08-04T06:58:39.755482Z","submitted_at":"2021-09-28T23:01:51Z","title":"VideoCLIP: Contrastive Pre-training for Zero-shot Video-Text Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.14084","snapshot_observed_at":"2026-08-06T11:46:45.517124Z","title":"Videoclip: Contrastive pre-training for zero-shot video-text understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.517124Z"},"links":{"cited_paper":"/paper/2109.14084","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:d7fe6719f23a633269013a68f1bb3b8789b45282187c2676b5391fcc5b389cb2","observation_id":"2335abde-285a-4cac-8447-b1a2c9cbfa25","resolution":{"observed_at":"2026-08-06T11:46:45.517124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-08-06T11:46:45.524128Z","title":"Demystify- ing clip data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.524128Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:45f6c4aa972d1553ec6b3887d5a09a22112b4139ec252a219d8f286be1db04ac","observation_id":"04d2f84a-85a6-43b4-b30b-3156a9177e25","resolution":{"observed_at":"2026-08-06T11:46:45.524128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.140060Z","title":"Coca: Contrastive captioners are image-text foundation models, 2022","venue":null,"work_id":"f23e25f3-dbf5-4223-9996-40191d958afc","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.531912Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:f1419cb3a5f9b1a25f15acaa189d888bfc97babc69d203251f2eafa81ffb5614","observation_id":"8a8a5c90-6af3-4ba7-85d2-b63b449ccf57","resolution":{"observed_at":"2026-08-06T11:46:46.148854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.20550","last_updated":"2024-04-05T05:29:29Z","snapshot_observed_at":"2026-07-06T16:41:11.586802Z","submitted_at":"2023-10-31T15:31:39Z","title":"CapsFusion: Rethinking Image-Text Data at Scale","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.20550","snapshot_observed_at":"2026-08-06T11:46:45.543788Z","title":"Caps- fusion: Rethinking image-text data at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.543788Z"},"links":{"cited_paper":"/paper/2310.20550","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:9f110ea1acc25ae6cedca0ede0a9c42efd1616946b8d53c22701092109690f46","observation_id":"85b5c121-2c3c-4e77-9e74-d93c9127a5d4","resolution":{"observed_at":"2026-08-06T11:46:45.543788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.110316Z","title":"Mmmu: A massive multi-discipline multimodal understand- ing and reasoning benchmark for expert agi","venue":null,"work_id":"8eeb3506-79f6-403f-a2c9-d9e802b6dd35","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.550364Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:31b4c15d28428d3cd11f90f42e315c555a3aaf858e878cc0d91a9b4a171d1884","observation_id":"c059c51c-33df-4d19-b842-cd199730cd5a","resolution":{"observed_at":"2026-08-06T11:46:46.116925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.085423Z","title":"When and why vision- language models behave like bags-of-words, and what to do about it? In International Conference on Learning Repre- sentations, 2023","venue":null,"work_id":"8741b7dd-a931-4545-881c-b5ac3f337a67","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.558671Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:1e5822f3af2410fdfae25e4916db77818ead0c146fb2eaacef819f741d4e80f3","observation_id":"8b7f51ce-0d25-44d5-9ed3-2353ba1dacc2","resolution":{"observed_at":"2026-08-06T11:46:46.091776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04867","last_updated":"2020-02-21T13:36:15Z","snapshot_observed_at":"2026-08-09T06:48:42.729935Z","submitted_at":"2019-10-01T17:06:29Z","title":"A Large-scale Study of Representation Learning with the Visual Task Adaptation Benchmark","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04867","snapshot_observed_at":"2026-08-06T11:46:45.568273Z","title":"A large-scale study of representation learning with the visual task adaptation benchmark","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.568273Z"},"links":{"cited_paper":"/paper/1910.04867","citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:b2b34cea90ac2bc14aaf19470e9481123e27eaae959bc5aba18f5d56948df942","observation_id":"9669d846-da58-4512-9db6-0f32adf4edfc","resolution":{"observed_at":"2026-08-06T11:46:45.568273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.061203Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":"cd7a4825-e6af-4316-a2bf-f0817f313919","year":2023},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.577179Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:70f0945c6e833c61cba9ba65aa1a19b6ac48cf191f7ae3b764a1c31365f766e1","observation_id":"0a7d25ac-ca9c-4a7c-8755-c435c58b6959","resolution":{"observed_at":"2026-08-06T11:46:46.069538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.033861Z","title":"Long-clip: Unlocking the long-text capability of clip","venue":null,"work_id":"3084d9ce-6acc-4c34-ac0d-9858dd8a4c9e","year":2024},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.583471Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:afc3d4715770f2b87846b16b860cae4a44ea9d25892baa4fd29b57bd90597715","observation_id":"8f631553-cbb2-41ca-b062-ad3de7d05214","resolution":{"observed_at":"2026-08-06T11:46:46.041210Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:46.005064Z","title":"Glipv2: Unifying localiza- tion and vision-language understanding","venue":null,"work_id":"733ffbd4-ac33-4c3c-a3d5-7c2ba341707b","year":2022},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.588353Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:ad040797b1b251b794d53be6e47400826078ec03b3cbbb88f1a186a0797c8aaf","observation_id":"4adfeb5e-0eca-42d0-8e52-8e9c2088bd60","resolution":{"observed_at":"2026-08-06T11:46:46.010744Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.978815Z","title":"Training setup and dataset scale","venue":null,"work_id":"b1ea089d-1ea7-42a9-ad3a-c529a56c0bf7","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.593767Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:9edc3f76e30798c19bcf8f8a8619057b8c703efaaeb5573b29f360b01a4a9d73","observation_id":"d794a3e4-5197-44fc-963e-5adfd3f1bf62","resolution":{"observed_at":"2026-08-06T11:46:45.988293Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:45.951549Z","title":"Examples We present some examples from the acquired dataset","venue":null,"work_id":"3ef7c314-09af-432f-9d3a-ad3249999015","year":null},"citing_paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T11:46:45.600246Z"},"links":{"citing_paper":"/paper/2507.22431"},"observation_digest":"sha256:7be38d569a42f6b6f09ea96d5c7bec2b016ff4111029948ccca47b1fcc70545b","observation_id":"72ead4ff-f661-4f49-ac37-0df59345b06e","resolution":{"observed_at":"2026-08-06T11:46:45.961209Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.22431","last_updated":"2025-07-30T07:21:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T11:46:43.177001Z","submitted_at":"2025-07-30T07:21:36Z","title":"HQ-CLIP: Leveraging Large Vision-Language Models to Create High-Quality Image-Text Datasets and CLIP Models"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":15,"verified_exact":0,"verified_fuzzy":29},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2507.22431."}