{"as_of":"2026-08-06T06:15:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:abc5dca931476f05143a813ce11c205301bc98245b1484204289c89ab75783d2","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T01:54:21.943160Z","state":"measured"},{"denominator":153,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":153,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":148,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T05:49:55.440845Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":80,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2303.15343","last_updated":"2023-09-27T12:05:41Z","snapshot_observed_at":"2026-07-06T15:08:30.190912Z","submitted_at":"2023-03-27T15:53:01Z","title":"Sigmoid Loss for Language Image Pre-Training","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T13:05:36.460932Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2303.15343"},"observation_digest":"sha256:89db6d7cd67ef86485418034c0d184239b4626a04d0794e3d6827120c9fa4cda","observation_id":"ae2f0075-525f-4e22-9d3a-765eb44e0ea0","resolution":{"observed_at":"2026-05-16T13:05:36.495674Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:7fbd502f7877a3109dee72a52999056edc68b06d560d204522fa7fffa392ab12","observation_id":"e12117b1-6c89-4e1c-a853-cc27b8436508","resolution":{"observed_at":"2026-05-13T23:30:00.627028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2306.13549","last_updated":"2024-11-29T15:51:23Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T15:21:52Z","title":"A Survey on Multimodal Large Language Models","version":4},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T02:56:41.658658Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2306.13549"},"observation_digest":"sha256:57997fac78cb0cb90950e81f10238d9e1d5f886dc8e38342faf1b08b10237cb2","observation_id":"b02c8501-d249-4816-abf6-0acedb722186","resolution":{"observed_at":"2026-05-16T02:56:42.459329Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2307.06942","last_updated":"2024-01-04T05:00:34Z","snapshot_observed_at":"2026-07-06T15:53:46.393481Z","submitted_at":"2023-07-13T17:58:32Z","title":"InternVid: A Large-scale Video-Text Dataset for Multimodal Understanding and Generation","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-15T06:30:22.431538Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2307.06942"},"observation_digest":"sha256:c898fcdb44f1f0894291047da396e66161307578fc43fb9d9ee8a3f80e00ec6c","observation_id":"d75a59a5-7492-4341-8443-e0ed414b8f02","resolution":{"observed_at":"2026-05-15T06:30:22.717922Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2311.17005","last_updated":"2024-05-23T14:49:29Z","snapshot_observed_at":"2026-07-06T16:53:55.269172Z","submitted_at":"2023-11-28T17:59:04Z","title":"MVBench: A Comprehensive Multi-modal Video Understanding Benchmark","version":4},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-17T20:22:34.954228Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2311.17005"},"observation_digest":"sha256:8e7dd1985bb098546dfe9a24559ed626c1a1b691016b22dd60716e1f68a1ebd3","observation_id":"0c9fbff2-1c1d-46ed-8d07-0a09f3a29daf","resolution":{"observed_at":"2026-05-17T20:22:35.139025Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-13T22:46:09.693156Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2312.14238"},"observation_digest":"sha256:7bdaf30e01cd6d41625ddfdf4c8d3de1f60f3eca5faa3d8a26aa5fcf75c56454","observation_id":"9f169a1d-6986-4a9a-849f-96dbd15aee9b","resolution":{"observed_at":"2026-05-13T22:46:10.115832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2312.16886","last_updated":"2023-12-30T04:59:21Z","snapshot_observed_at":"2026-07-29T22:12:01.108911Z","submitted_at":"2023-12-28T08:21:24Z","title":"MobileVLM : A Fast, Strong and Open Vision Language Assistant for Mobile Devices","version":2},"reference_index":111,"source":"pdf_text","source_observed_at":"2026-05-16T16:35:37.937462Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2312.16886"},"observation_digest":"sha256:4891cca0d845e261d4d56561dd7bcbf64906c31b7813e990c273d3772f2ec188","observation_id":"0dafeb92-717b-4721-97ee-d5280200245b","resolution":{"observed_at":"2026-05-16T16:35:38.118073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2401.03568","last_updated":"2024-01-25T21:20:27Z","snapshot_observed_at":"2026-07-30T06:39:40.880794Z","submitted_at":"2024-01-07T19:11:18Z","title":"Agent AI: Surveying the Horizons of Multimodal Interaction","version":2},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-18T14:25:58.876978Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2401.03568"},"observation_digest":"sha256:b78c114e5ce5aec55e842739bf6fba0bec0318601caff54cd048614226aea343","observation_id":"40e29025-82a3-4831-9d38-486880913f7b","resolution":{"observed_at":"2026-05-18T14:25:59.311906Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2402.15852","last_updated":"2024-06-30T11:14:13Z","snapshot_observed_at":"2026-07-06T17:34:57.509162Z","submitted_at":"2024-02-24T16:39:16Z","title":"NaVid: Video-based VLM Plans the Next Step for Vision-and-Language Navigation","version":7},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-18T04:55:20.362512Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2402.15852"},"observation_digest":"sha256:8801943d42b622dd5f0750e630ee1e4b2ab155990556f9a968bffb4bfd475c4b","observation_id":"8e50dc18-bbd7-4efc-bb83-1dbe5e3c12a5","resolution":{"observed_at":"2026-05-18T04:55:20.518354Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2403.13805","last_updated":"2026-05-15T05:14:37Z","snapshot_observed_at":"2026-07-06T17:47:51.284226Z","submitted_at":"2024-03-20T17:59:55Z","title":"RAR: Retrieving And Ranking Augmented MLLMs for Visual Recognition","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-24T03:31:58.848180Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2403.13805"},"observation_digest":"sha256:d8b2fa165010fbc0aff3e9370ae9e4abd70c7a6ee52a35a55790e0929000cae4","observation_id":"221204e8-98ad-4dc9-9854-48309924cf39","resolution":{"observed_at":"2026-05-24T03:33:50.836780Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-15T20:18:15.439163Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2404.12390"},"observation_digest":"sha256:440afdcfd884fce3feb02ae72c8dc09c53bf8ecb1233d33684c793923413a5c0","observation_id":"b8d17ed1-6576-4d50-ad15-e05a10d25bd1","resolution":{"observed_at":"2026-05-15T20:18:15.564212Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2406.08035","last_updated":"2025-08-09T10:54:59Z","snapshot_observed_at":"2026-08-05T10:34:24.268925Z","submitted_at":"2024-06-12T09:36:52Z","title":"LVBench: An Extreme Long Video Understanding Benchmark","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-19T11:55:30.048525Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2406.08035"},"observation_digest":"sha256:5a3fe61c2c20bf3018f4ee11a12369e6b6b4f9011c0de08166f1b07c6a5526d3","observation_id":"4c174f23-7ae4-45ae-9805-5c7e612debb2","resolution":{"observed_at":"2026-05-19T11:55:30.107505Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2406.09411","last_updated":"2024-07-02T01:56:14Z","snapshot_observed_at":"2026-08-03T15:14:54.643258Z","submitted_at":"2024-06-13T17:59:52Z","title":"MuirBench: A Comprehensive Benchmark for Robust Multi-image Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-17T01:09:30.360275Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2406.09411"},"observation_digest":"sha256:37f4ea7a426b9cd14bc7af7a912004b711a13302b08119cd2a8332452e480f2f","observation_id":"49d8516d-9262-4c1c-a24f-9aa1bdd97fa8","resolution":{"observed_at":"2026-05-17T01:09:30.416809Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"reference_index":123,"source":"pdf_text","source_observed_at":"2026-05-17T00:05:03.547664Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2406.16860"},"observation_digest":"sha256:6ecbea57db9c5dadd6f34cc2d79d9db6c4029534fe52400a915452d1a5addda3","observation_id":"dc55ca00-0a0b-4316-826b-277fe5ea1a14","resolution":{"observed_at":"2026-05-17T00:05:03.704852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T22:52:20.935555Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2407.12580"},"observation_digest":"sha256:64a7cdf885e0dc66a61e8e7c11b133f6123832bfea7d8c5936d2d1b13ad2a037","observation_id":"01cd2b6d-5285-4c09-9eb0-122aa8847b25","resolution":{"observed_at":"2026-05-16T22:52:20.993088Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2408.16500","last_updated":"2024-08-29T12:59:12Z","snapshot_observed_at":"2026-08-05T11:54:14.447608Z","submitted_at":"2024-08-29T12:59:12Z","title":"CogVLM2: Visual Language Models for Image and Video Understanding","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-16T20:10:27.633010Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2408.16500"},"observation_digest":"sha256:da5060f4f80bb810b46cbf856a12f903d70953936aa1085e690a170e1ce75bde","observation_id":"a75f5f2b-8ca2-4d28-8161-68348ad4b46a","resolution":{"observed_at":"2026-05-16T20:10:27.731179Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2410.05160","last_updated":"2025-01-02T05:26:47Z","snapshot_observed_at":"2026-07-06T19:29:05.492290Z","submitted_at":"2024-10-07T16:14:05Z","title":"VLM2Vec: Training Vision-Language Models for Massive Multimodal Embedding Tasks","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-17T21:19:43.882232Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2410.05160"},"observation_digest":"sha256:bd2e1250e4544d784b4dca5508c5d159f2cae01ad3cc8087c9bb1522c10f3340","observation_id":"b9d723cf-4dce-4df9-ae41-a22f7e88f4af","resolution":{"observed_at":"2026-05-17T21:19:44.022275Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2410.13848","last_updated":"2024-10-17T17:58:37Z","snapshot_observed_at":"2026-08-03T03:16:45.693966Z","submitted_at":"2024-10-17T17:58:37Z","title":"Janus: Decoupling Visual Encoding for Unified Multimodal Understanding and Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-15T22:09:16.001309Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2410.13848"},"observation_digest":"sha256:42ac75cd2c8d72c267ae9208f587b730245a5b3eefd124d0eac7ee90ac011cce","observation_id":"f3c40a80-aaae-4644-a7e6-9cbeaecad50a","resolution":{"observed_at":"2026-05-15T22:09:16.267045Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2412.02930","last_updated":"2026-04-19T04:24:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-04T00:50:33Z","title":"TemporalVLM: Video LLMs for Temporal Reasoning in Long Videos","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-23T08:08:01.889675Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.02930"},"observation_digest":"sha256:993424424c471553384b33c401cdff2048355cd8c4fd48af630db2f6d51a6139","observation_id":"c158e121-1f3b-4453-ba3a-598fe83fb317","resolution":{"observed_at":"2026-05-23T08:12:43.893590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2412.06224","last_updated":"2025-02-06T10:14:36Z","snapshot_observed_at":"2026-07-06T20:03:42.903210Z","submitted_at":"2024-12-09T05:55:55Z","title":"Uni-NaVid: A Video-based Vision-Language-Action Model for Unifying Embodied Navigation Tasks","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-16T19:51:36.137985Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.06224"},"observation_digest":"sha256:34b54beb9b52abdc88c3a4fb09116b20686288b5d6e8c6bfecff952e9052c4b6","observation_id":"c211992d-0b7a-4c40-83ca-94bf2190d47a","resolution":{"observed_at":"2026-05-16T19:51:36.369148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"reference_index":187,"source":"arxiv_source","source_observed_at":"2026-05-17T07:51:12.953777Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2412.14164"},"observation_digest":"sha256:b1d55858176e43405d3969aaf8aec116477c7fb1b370bfcadc1a9373b416524a","observation_id":"d4b1ba38-dc02-4bf6-9bf2-3ea499ab52d6","resolution":{"observed_at":"2026-05-17T07:51:13.391038Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T15:49:22.279848Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.14786"},"observation_digest":"sha256:ea31c188d2592b61a5adbb9a72977154975207f4c02ca75793c2ea90252e802f","observation_id":"2f950d82-b38b-482a-b3af-a31985f2dcf6","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2502.18816","last_updated":"2026-05-07T07:59:16Z","snapshot_observed_at":"2026-08-06T02:20:50.026726Z","submitted_at":"2025-02-26T04:50:20Z","title":"Grad-ECLIP: Gradient-based Visual and Textual Explanations for CLIP","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-05-23T02:21:09.704462Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2502.18816"},"observation_digest":"sha256:917731b63611b96152a1226035a958ad6755dc0c00700b3a48c212d903ca49bb","observation_id":"5c7e599d-84db-411c-97b8-1fe0f5d5668f","resolution":{"observed_at":"2026-05-23T02:22:25.142222Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2503.22171","last_updated":"2026-04-17T04:53:40Z","snapshot_observed_at":"2026-07-06T21:00:08.046336Z","submitted_at":"2025-03-28T06:18:15Z","title":"An Empirical Study of Validating Synthetic Data for Text-Based Person Retrieval","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-22T22:59:36.542774Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2503.22171"},"observation_digest":"sha256:d15e7ef11a300d7754a54b731c79b95a8045ae7ca4e4e14841cff3715663a65e","observation_id":"a5708f05-1ea0-4ae6-8afe-a53c1e48e17c","resolution":{"observed_at":"2026-05-22T23:02:13.620465Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T01:13:57.368874Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2504.07615"},"observation_digest":"sha256:6593d412dbe0baaeaff1f77552517a4f1aa60440766c9272ec1343507e3eb708","observation_id":"0a0c0629-f13f-49fd-8b7a-bdcf99bef568","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2504.13181","last_updated":"2025-04-28T18:01:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-17T17:59:57Z","title":"Perception Encoder: The best visual embeddings are not at the output of the network","version":2},"reference_index":129,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:15.681336Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2504.13181"},"observation_digest":"sha256:619f1d5828a33cec0b72ed1d9464f783a059ff5d497d75abda7e28e34fc13cf3","observation_id":"b37da83f-52b4-4b70-b983-5f55f948a42b","resolution":{"observed_at":"2026-05-13T22:21:15.801070Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2504.14988","last_updated":"2026-04-30T15:12:07Z","snapshot_observed_at":"2026-08-03T01:40:56.706749Z","submitted_at":"2025-04-21T09:30:41Z","title":"Benchmarking Large Vision-Language Models on Fine-Grained Image Tasks: A Comprehensive Evaluation","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-22T18:26:12.597756Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2504.14988"},"observation_digest":"sha256:b1f143365f24f8b2c89f1a643dc324ee0c9fb96974fded0a99bc95e6bb151d95","observation_id":"364b53bc-a8d8-4e6d-8713-91222701105e","resolution":{"observed_at":"2026-05-22T18:26:55.266321Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2507.14137","last_updated":"2026-04-25T14:06:10Z","snapshot_observed_at":"2026-07-06T21:59:25.077202Z","submitted_at":"2025-07-18T17:59:55Z","title":"Franca: Nested Matryoshka Clustering for Scalable Visual Representation Learning","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-19T03:39:52.969100Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2507.14137"},"observation_digest":"sha256:7a8a743837849ccd7ba59803aaa942e1902d76c7eba1d45574a9901d67af9886","observation_id":"40473f12-a9fc-4851-a7b8-6e9de38e6e0f","resolution":{"observed_at":"2026-05-19T03:42:01.374084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T05:49:55.440845Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01178","last_updated":"2025-08-02T03:33:47Z","snapshot_observed_at":"2026-08-06T05:49:49.921453Z","submitted_at":"2025-08-02T03:33:47Z","title":"Advancing the Foundation Model for Music Understanding","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-06T05:49:55.440845Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.01178"},"observation_digest":"sha256:9accf1123f4ffa496767d73a9019dfb4e1070a6807a3593c08589cedbee3c0f5","observation_id":"e0c2dc26-04ff-4201-9ba8-c0c178d285f3","resolution":{"observed_at":"2026-08-06T05:49:55.440845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T05:48:57.992925Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01219","last_updated":"2025-08-02T06:33:58Z","snapshot_observed_at":"2026-08-06T05:48:50.663004Z","submitted_at":"2025-08-02T06:33:58Z","title":"Eigen Neural Network: Unlocking Generalizable Vision with Eigenbasis","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T05:48:57.992925Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.01219"},"observation_digest":"sha256:679d254904d6316d401088bf0675e2631a871cd1fd1c6b4fe0869586c2aa9c38","observation_id":"a5397b14-2399-4a75-848c-85a8f593c286","resolution":{"observed_at":"2026-08-06T05:48:57.992925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T05:36:21.049168Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.01540","last_updated":"2025-08-03T01:49:08Z","snapshot_observed_at":"2026-08-06T05:36:12.272501Z","submitted_at":"2025-08-03T01:49:08Z","title":"MagicVL-2B: Empowering Vision-Language Models on Mobile Devices with Lightweight Visual Encoders via Curriculum Learning","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-06T05:36:21.049168Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.01540"},"observation_digest":"sha256:55e3f3f7adcfaf40d264658aabc9d28ea6776171a04df6e21850aef1045e70c9","observation_id":"204367c9-8c6e-4356-8b10-1497e7e306f2","resolution":{"observed_at":"2026-08-06T05:36:21.049168Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-06T00:52:33.344662Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.04211","last_updated":"2025-08-06T08:46:47Z","snapshot_observed_at":"2026-08-06T00:52:28.493584Z","submitted_at":"2025-08-06T08:46:47Z","title":"What Holds Back Open-Vocabulary Segmentation?","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T00:52:33.344662Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.04211"},"observation_digest":"sha256:15362cd07bc7a90e840d5491ab7f722daf4d09411f72e84475b6781806fb27b4","observation_id":"45d2c4fc-cb69-406c-95b0-d4f156f6fb3d","resolution":{"observed_at":"2026-08-06T00:52:33.344662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T23:17:06.662323Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.05547","last_updated":"2025-08-07T16:27:37Z","snapshot_observed_at":"2026-08-05T23:17:01.532309Z","submitted_at":"2025-08-07T16:27:37Z","title":"Adapting Vision-Language Models Without Labels: A Comprehensive Survey","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-05T23:17:06.662323Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.05547"},"observation_digest":"sha256:c3c7838ee4db6e06cf04eb60d357dc9a9d78a1543009bc01e3777b30a714fa8a","observation_id":"4b059712-fd22-4477-b17a-1ad35fee2618","resolution":{"observed_at":"2026-08-05T23:17:06.662323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T21:01:21.903186Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.09584","last_updated":"2025-08-14T11:57:08Z","snapshot_observed_at":"2026-08-05T21:01:20.567980Z","submitted_at":"2025-08-13T07:58:01Z","title":"SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T21:01:21.903186Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.09584"},"observation_digest":"sha256:0a13dbb90108eef0d8b12915aca0b8434b2e679e8c231ca23e2e2125c5bf6dc1","observation_id":"affc2308-9aa7-48b9-a23b-d18a1657460c","resolution":{"observed_at":"2026-08-05T21:01:21.903186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T23:32:17.731677Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.10922","last_updated":"2025-08-07T08:52:11Z","snapshot_observed_at":"2026-08-05T23:32:12.717763Z","submitted_at":"2025-08-07T08:52:11Z","title":"A Survey on Video Temporal Grounding with Multimodal Large Language Model","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T23:32:17.731677Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.10922"},"observation_digest":"sha256:8ca8801d62502bfbea485fedab1100fcf51023b922200d1f11a39113a3736a89","observation_id":"3168c6c6-3f0d-4066-88d2-dc460577a500","resolution":{"observed_at":"2026-08-05T23:32:17.731677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T16:56:26.617118Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17417","last_updated":"2025-08-24T15:45:22Z","snapshot_observed_at":"2026-08-05T16:56:03.651826Z","submitted_at":"2025-08-24T15:45:22Z","title":"Constrained Prompt Enhancement for Improving Zero-Shot Generalization of Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T16:56:26.617118Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.17417"},"observation_digest":"sha256:39307ce8bf640fba055a77d7745b55b5e63c55d490bb4714eeb3efe23bcc4a5d","observation_id":"e6a312fb-d024-40b9-b282-71b5beeada23","resolution":{"observed_at":"2026-08-05T16:56:26.617118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T14:59:19.599119Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.20691","last_updated":"2025-08-28T11:50:22Z","snapshot_observed_at":"2026-08-06T05:56:44.188729Z","submitted_at":"2025-08-28T11:50:22Z","title":"MobileCLIP2: Improving Multi-Modal Reinforced Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T14:59:19.599119Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.20691"},"observation_digest":"sha256:5a12140ce8491950e21a3138b1e61c5aac304efde2f8e9a7193ebf134c6ab981","observation_id":"9c9abd3d-f647-47b3-830b-12f952e50b1c","resolution":{"observed_at":"2026-08-05T14:59:19.599119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2508.20765","last_updated":"2026-04-08T02:55:23Z","snapshot_observed_at":"2026-08-02T23:26:21.127911Z","submitted_at":"2025-08-28T13:19:49Z","title":"Looking Beyond the Obvious: A Survey on Abstract Concept Recognition for Video Understanding","version":2},"reference_index":143,"source":"pdf_text","source_observed_at":"2026-05-18T20:26:16.133860Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2508.20765"},"observation_digest":"sha256:903efb9e70054c8de75dcf9358fb1ee7c9cabfbb40648e0aa39ee5364b25eb36","observation_id":"406f1b2e-2c25-44fd-b7c9-1c26f78867aa","resolution":{"observed_at":"2026-05-18T20:26:50.365543Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2509.00798","last_updated":"2026-04-22T02:56:00Z","snapshot_observed_at":"2026-07-29T03:25:03.283753Z","submitted_at":"2025-08-31T11:14:54Z","title":"Progressive Multimodal Search and Reasoning for Knowledge-Intensive Visual Question Answering","version":7},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-18T20:04:52.852253Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.00798"},"observation_digest":"sha256:07c61f1ebd10c38d8139c6c56cdb1bf7dd64d7e2b31387d7dd72d345d360b502","observation_id":"6aceb296-ed2c-4b6d-90ac-699e9b6347f5","resolution":{"observed_at":"2026-05-18T20:06:49.812306Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T12:22:35.731050Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.01644","last_updated":"2025-09-01T17:38:21Z","snapshot_observed_at":"2026-08-05T12:22:30.859046Z","submitted_at":"2025-09-01T17:38:21Z","title":"OpenVision 2: A Family of Generative Pretrained Visual Encoders for Multimodal Learning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T12:22:35.731050Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.01644"},"observation_digest":"sha256:d9edfedb8ae4675c0c792a2664bde073485ffc5a48c9ad1021f629441cd61e87","observation_id":"2d429898-6337-47ec-82bf-e4572a281f2c","resolution":{"observed_at":"2026-08-05T12:22:35.731050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T05:20:00.963413Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.05659","last_updated":"2025-09-06T09:29:48Z","snapshot_observed_at":"2026-08-05T05:19:59.075471Z","submitted_at":"2025-09-06T09:29:48Z","title":"EditIDv2: Editable ID Customization with Data-Lubricated ID Feature Integration for Text-to-Image Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T05:20:00.963413Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.05659"},"observation_digest":"sha256:172c3b561b6291d57f5c204366abccd9c4f69412b38a63ea84bcb8e8d72538bf","observation_id":"e627282e-42a3-4f9b-b6dc-ab948a7b2dd6","resolution":{"observed_at":"2026-08-05T05:20:00.963413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T20:06:09.054038Z","title":"EV A-CLIP: Improved Training Techniques for CLIP at Scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08897","last_updated":"2025-09-10T18:00:29Z","snapshot_observed_at":"2026-08-04T21:18:14.752526Z","submitted_at":"2025-09-10T18:00:29Z","title":"Recurrence Meets Transformers for Universal Multimodal Retrieval","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T20:06:09.054038Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.08897"},"observation_digest":"sha256:8f0936e8632b65f2a1034172729a4fc97486c4e6c1f2b2c7dfe1aa95f9a46ac6","observation_id":"91419f0c-a081-47d8-a75b-c9473fdbcc9b","resolution":{"observed_at":"2026-08-04T20:06:09.054038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-04T13:51:42.554345Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-18T13:00:31.952588Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:11f8440623506ad96d8c9f2885dc0d4382308581d47772883c54ed00db6e226e","observation_id":"5f796c12-9c89-471f-8c58-1869dedd49f4","resolution":{"observed_at":"2026-05-18T13:01:23.521764Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T13:51:46.961197Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.24621","last_updated":"2026-05-25T10:53:36Z","snapshot_observed_at":"2026-08-04T13:51:42.554345Z","submitted_at":"2025-09-29T11:28:42Z","title":"FreeRet: MLLMs as Training-Free Retrievers","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T13:51:46.961197Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2509.24621"},"observation_digest":"sha256:8eadbabc5f67e6a6db5b96b7a0d8715aa95dad7f6b2b0bc1bde85642f3384edf","observation_id":"917f7d0a-cc6d-4d83-a965-69ea11d1b269","resolution":{"observed_at":"2026-08-04T13:51:46.961197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T10:18:43.621652Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.10921","last_updated":"2026-05-25T02:35:42Z","snapshot_observed_at":"2026-08-04T10:18:40.408381Z","submitted_at":"2025-10-13T02:32:07Z","title":"FG-CLIP 2: A Bilingual Fine-grained Vision-Language Alignment Model","version":3},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-04T10:18:43.621652Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2510.10921"},"observation_digest":"sha256:d941f839a9e1c6b58ed22c1776979f747083aaf2d48bd7c28f98fcc71afab588","observation_id":"42f0c0bc-4e7b-4dbd-a477-6dc96c8ff0d6","resolution":{"observed_at":"2026-08-04T10:18:43.621652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2510.18457","last_updated":"2026-04-23T08:02:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-21T09:30:45Z","title":"VFM-VAE: Vision Foundation Models Can Be Good Tokenizers for Latent Diffusion Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T05:22:05.125849Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2510.18457"},"observation_digest":"sha256:d22f3196c3e6f6704c644330fcd713ff362a436c612b69b9b61bf3b092ead328","observation_id":"309d3348-5a97-4c30-a655-16d62f2c23a9","resolution":{"observed_at":"2026-05-18T05:22:24.001325Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T07:22:08.392322Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2510.27391","last_updated":"2026-05-28T13:27:52Z","snapshot_observed_at":"2026-08-04T07:03:11.161864Z","submitted_at":"2025-10-31T11:32:15Z","title":"Modality Alignment across Trees on Heterogeneous Hyperbolic Manifolds","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T07:22:08.392322Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2510.27391"},"observation_digest":"sha256:bd012f7e61990f63d5116ef5615534cec1ef25d734731f91ed480f582ea5a24a","observation_id":"ae9baa82-be3a-43dd-8b0c-984158138234","resolution":{"observed_at":"2026-08-04T07:22:08.392322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2511.12034","last_updated":"2026-05-12T07:28:48Z","snapshot_observed_at":"2026-08-02T17:34:14.031307Z","submitted_at":"2025-11-15T05:01:43Z","title":"Calibrated Multimodal Representation Learning with Missing Modalities","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-05-17T22:08:07.217659Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2511.12034"},"observation_digest":"sha256:29cb7e34e7984268d9a027e69b6f8a15290c06e6c90cbabe36857755228ac7bb","observation_id":"454c9428-df48-4687-93bf-67bfdabbfa55","resolution":{"observed_at":"2026-05-17T22:10:22.645035Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-03T21:42:46.973924Z","title":"EV A-CLIP: Improved training techniques for CLIP at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.14143","last_updated":"2026-06-08T00:19:12Z","snapshot_observed_at":"2026-08-03T21:42:43.699429Z","submitted_at":"2025-11-18T05:03:17Z","title":"SMART: Shot-Aware Multimodal Video Moment Retrieval with Audio-Enhanced MLLM","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T21:42:46.973924Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2511.14143"},"observation_digest":"sha256:a00c3c73344f15acef828ec58606a1bf62d7ce630a25755fbba1ad42bf47d450","observation_id":"c4bd4a5a-8f24-4c82-b3c8-e7418fded368","resolution":{"observed_at":"2026-08-03T21:42:46.973924Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2511.23170","last_updated":"2026-04-20T09:59:19Z","snapshot_observed_at":"2026-08-03T01:40:56.280302Z","submitted_at":"2025-11-28T13:28:18Z","title":"PowerCLIP: Powerset Alignment for Contrastive Pre-Training","version":5},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T04:57:44.794342Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2511.23170"},"observation_digest":"sha256:aa1c5c96964af345e18a1014540925320246c598fcf67152eb34f9aaef65ff15","observation_id":"cdb73885-1c46-440f-ad65-7759c4bac2b1","resolution":{"observed_at":"2026-05-17T04:59:03.952297Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-03T11:22:14.718656Z","title":"Camilo Tamayo-Rousseau, Yunjia Zhao, Yiqun Zhang, and Randall Balestriero","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06891","last_updated":"2026-06-29T13:35:54Z","snapshot_observed_at":"2026-08-03T11:22:13.655812Z","submitted_at":"2026-01-11T12:31:55Z","title":"CLIMP: Contrastive Language-Image Mamba Pretraining","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T11:22:14.718656Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2601.06891"},"observation_digest":"sha256:1deccd4d7c8cc8e201407c475089bc24fd30c8b1177f2b65816d8928eb5970d7","observation_id":"ba39f140-8359-4390-8f64-4b034923e361","resolution":{"observed_at":"2026-08-03T11:22:14.718656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2602.00104","last_updated":"2026-06-03T13:13:52Z","snapshot_observed_at":"2026-08-03T08:13:50.606822Z","submitted_at":"2026-01-25T12:12:12Z","title":"R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T10:46:17.411843Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.00104"},"observation_digest":"sha256:d9742a3323333143821b90cab3ccb60bb011c5f36b4aec7baaa5ef9e968e944f","observation_id":"7b4f20f0-2d11-43ac-bc66-bc4774e5e052","resolution":{"observed_at":"2026-05-16T10:47:45.501186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-03T08:13:53.659640Z","title":"Eva-clip: Improved training techniques for clip at scale,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.00104","last_updated":"2026-06-03T13:13:52Z","snapshot_observed_at":"2026-08-03T08:13:50.606822Z","submitted_at":"2026-01-25T12:12:12Z","title":"R3G: A Reasoning-Retrieval-Reranking Framework for Vision-Centric Answer Generation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T08:13:53.659640Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.00104"},"observation_digest":"sha256:c572fd955152122f6a29731c4e0308e8495e8e8a36a97bf1a20e58a8b5d6c4f1","observation_id":"c5bcda11-180d-44ba-b6f2-16c95b643696","resolution":{"observed_at":"2026-08-03T08:13:53.659640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2602.00937","last_updated":"2026-05-06T16:54:58Z","snapshot_observed_at":"2026-08-02T08:57:24.060251Z","submitted_at":"2026-01-31T23:32:54Z","title":"CLAMP: Contrastive Learning for 3D Multi-View Action-Conditioned Robotic Manipulation Pretraining","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T08:24:44.943709Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.00937"},"observation_digest":"sha256:5b10ae2d1f9bf13f69aefb5b0f72e943b69d8194cd06cc9b0b8c843fb346feaf","observation_id":"f17a7717-22af-45d5-9ee7-f604b22c5562","resolution":{"observed_at":"2026-05-16T08:27:36.880704Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2602.07026","last_updated":"2026-06-05T02:27:27Z","snapshot_observed_at":"2026-08-03T05:34:25.089131Z","submitted_at":"2026-02-02T13:59:39Z","title":"Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T08:17:29.924860Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.07026"},"observation_digest":"sha256:23131aeac43f38daff18f130f9745650dbd063d2f19cc3663e40f5b5504d9702","observation_id":"2ae307be-0700-4d1b-b25c-230300ffe8cb","resolution":{"observed_at":"2026-05-16T08:17:36.109866Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-03T05:34:29.156287Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.07026","last_updated":"2026-06-05T02:27:27Z","snapshot_observed_at":"2026-08-03T05:34:25.089131Z","submitted_at":"2026-02-02T13:59:39Z","title":"Modality Gap-Driven Subspace Alignment Training Paradigm For Multimodal Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T05:34:29.156287Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.07026"},"observation_digest":"sha256:be44ef5c671b6c3aeba57a4a47d8887f91cb85b161bed0ce05f2cb12b8738546","observation_id":"b76a954a-60de-4052-9867-d07859b42d8d","resolution":{"observed_at":"2026-08-03T05:34:29.156287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2602.11183","last_updated":"2026-05-07T07:20:15Z","snapshot_observed_at":"2026-07-06T22:45:29.609382Z","submitted_at":"2026-01-30T05:03:08Z","title":"Mitigating Error Accumulation in Continuous Navigation via Memory-Augmented Kalman Filtering","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T09:45:53.868748Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.11183"},"observation_digest":"sha256:e80d9fd6412a2107593b8e00ee04ecb6c7f9b91f013e75b51b115c4348f426a0","observation_id":"18bf3ac8-75e0-4c52-9119-7bb7f850d2c3","resolution":{"observed_at":"2026-05-16T09:47:41.872584Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2602.22394","last_updated":"2026-04-14T12:53:45Z","snapshot_observed_at":"2026-07-06T22:47:06.893212Z","submitted_at":"2026-02-25T20:42:35Z","title":"Vision Transformers Need More Than Registers","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-15T19:08:50.579190Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2602.22394"},"observation_digest":"sha256:b9afdef69c076cd849f86c9902b2b6061a5ebeac8df53ae1c6fad4ebb87674f3","observation_id":"213a78c7-16c9-46c7-bafe-f8660ede7be5","resolution":{"observed_at":"2026-05-15T19:10:15.678117Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-07-15T14:43:21.866055Z","title":"Eva-clip: Improved training techniques for clip at scale.ArXiv, abs/2303.15389,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.05256","last_updated":"2026-07-02T16:41:10Z","snapshot_observed_at":"2026-08-06T04:07:42.199986Z","submitted_at":"2026-03-05T15:08:06Z","title":"Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-15T14:43:21.866055Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.05256"},"observation_digest":"sha256:f251f4b4682978180f2b60223ef43f9870046cd08fa00d906551ce1f0041cbee","observation_id":"c703e467-541e-4475-8e23-6bbed5b26eeb","resolution":{"observed_at":"2026-07-15T14:43:21.866055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T13:11:54.384284Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:d4605f90b571db8c1abdfcb866af70fcfe43bb31c5c870c4a78a9f4c1b06b866","observation_id":"a1bafc80-6dde-46d0-a709-4f962c83870a","resolution":{"observed_at":"2026-05-15T13:15:50.518716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-07-14T23:55:24.006436Z","title":"Eva-clip: Improved training techniques for clip at scale.ArXiv, abs/2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.09921","last_updated":"2026-07-02T16:25:34Z","snapshot_observed_at":"2026-07-14T23:55:23.688065Z","submitted_at":"2026-03-10T17:18:53Z","title":"WikiCLIP: An Efficient Contrastive Baseline for Open-domain Visual Entity Recognition","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-14T23:55:24.006436Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.09921"},"observation_digest":"sha256:253dd90a6c941a649b0ef40dd9e2aa9b107a0933a0cbe70db41c068eddbce351","observation_id":"a4dd4b93-5251-4c1a-839e-c3a7b5e5d2e1","resolution":{"observed_at":"2026-07-14T23:55:24.006436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-07-14T22:19:38.973091Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.12433","last_updated":"2026-06-02T23:51:35Z","snapshot_observed_at":"2026-07-14T22:19:37.680401Z","submitted_at":"2026-03-12T20:33:19Z","title":"Revisiting Model Stitching In the Foundation Model Era","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-14T22:19:38.973091Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.12433"},"observation_digest":"sha256:5b266ae0d478a59b68dbea835c06bbf3888404e48951f38ae6ae84114f797f57","observation_id":"4626e353-1038-4c0e-a310-470ee0b2c314","resolution":{"observed_at":"2026-07-14T22:19:38.973091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2603.21824","last_updated":"2026-05-08T03:09:52Z","snapshot_observed_at":"2026-07-06T22:50:05.914888Z","submitted_at":"2026-03-23T11:06:57Z","title":"SteelDefectX: A Multi-Form Vision-Language Dataset and Benchmark for Steel Surface Defect Analysis","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T00:42:40.501053Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.21824"},"observation_digest":"sha256:73dfb1391b3e11816b7499fc1d8ecd9f15601d1747cb56d95d3a1cba0806ebef","observation_id":"25a2730e-4f28-4c42-ad70-a433ef7707ac","resolution":{"observed_at":"2026-05-15T00:43:24.372856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2603.27759","last_updated":"2026-04-17T09:33:07Z","snapshot_observed_at":"2026-07-06T22:51:00.579062Z","submitted_at":"2026-03-29T16:35:18Z","title":"When Surfaces Lie: Exploiting Wrinkle-Induced Attention Shift to Attack Vision-Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-14T21:19:04.468630Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.27759"},"observation_digest":"sha256:2badf1e4328a518d7cc8aa3d7ddcb4c12e1ee682ba1432688c6f9db2c910eb9a","observation_id":"f6eb0dce-44dd-409f-ac3e-e5d9f962cbd4","resolution":{"observed_at":"2026-05-14T21:19:28.032626Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T05:42:17.220750Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.28568","last_updated":"2026-08-03T06:37:39Z","snapshot_observed_at":"2026-08-06T06:15:06.146293Z","submitted_at":"2026-03-30T15:24:34Z","title":"XSPA: Crafting Imperceptible X-Shaped Sparse Adversarial Perturbations for Transferable Attacks on VLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T05:42:17.220750Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.28568"},"observation_digest":"sha256:ff07cc9fbcff965bf59d96de122fc316979923d10c43d71bf804ee34ba1dccc3","observation_id":"99ad757c-a944-4b0c-8ff2-e602d0c9f040","resolution":{"observed_at":"2026-08-04T05:42:17.220750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-07-13T15:38:41.390945Z","title":"arXiv preprint arXiv:2303.15389 (2023) 6, 7, 25, 27","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2603.29616","last_updated":"2026-07-02T03:18:44Z","snapshot_observed_at":"2026-08-02T22:09:19.847253Z","submitted_at":"2026-03-31T11:37:42Z","title":"Video-Oasis: Rethinking Evaluation of Video Understanding","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-13T15:38:41.390945Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2603.29616"},"observation_digest":"sha256:975085c60688ca910971377711b201871af25c6956fdcde30fbac2cabdad2c60","observation_id":"5059d5a5-ed91-4b05-a0bb-bedd13ee31c4","resolution":{"observed_at":"2026-07-13T15:38:41.390945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.02546","last_updated":"2026-07-02T01:57:06Z","snapshot_observed_at":"2026-08-02T20:00:32.514238Z","submitted_at":"2026-04-02T21:54:43Z","title":"RGB-Pointmap Pretraining for Unified 3D Scene Understanding","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T21:19:49.421653Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.02546"},"observation_digest":"sha256:3c121ca4d03853de4f6a52651fe753f61ed4eeb7dbe093355d8ab7681183dfcc","observation_id":"51bcb73d-4e4a-49d5-aa19-4ffc23d77795","resolution":{"observed_at":"2026-05-13T21:23:17.889832Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.03117","last_updated":"2026-07-18T15:19:06Z","snapshot_observed_at":"2026-08-02T16:52:00.328103Z","submitted_at":"2026-04-03T15:42:55Z","title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T19:43:29.058335Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.03117"},"observation_digest":"sha256:289f44a99f45fddc0cb82cd34d92114278a71f2713fe8e1b958c4a89f14f8ce9","observation_id":"c74b8aad-87a8-4339-ac73-1a0c9e8d9472","resolution":{"observed_at":"2026-05-13T19:48:11.631135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-02T16:52:02.612278Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.03117","last_updated":"2026-07-18T15:19:06Z","snapshot_observed_at":"2026-08-02T16:52:00.328103Z","submitted_at":"2026-04-03T15:42:55Z","title":"Revealing Physical-World Semantic Vulnerabilities: Universal Adversarial Patch for Infrared Vision-Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T16:52:02.612278Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.03117"},"observation_digest":"sha256:ef51379dcd2bc08cb4e3ada734e210e25883460ee2b7aa33dfa2c172b1ffb143","observation_id":"01c1ef13-9723-42db-817f-f4f29fca4bbd","resolution":{"observed_at":"2026-08-02T16:52:02.612278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.03231","last_updated":"2026-04-03T17:59:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T17:59:51Z","title":"CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T20:28:30.864143Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.03231"},"observation_digest":"sha256:766560c85ac19217dc996588346bba8712bd3d0a6a150063907b1bd985eab026","observation_id":"2596e2c1-cf21-440c-ba53-2ffff9b0dae0","resolution":{"observed_at":"2026-05-13T20:33:17.151630Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.05818","last_updated":"2026-04-14T13:54:15Z","snapshot_observed_at":"2026-07-06T22:54:26.231593Z","submitted_at":"2026-04-07T12:52:38Z","title":"WikiSeeker: Rethinking the Role of Vision-Language Models in Knowledge-Based Visual Question Answering","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T19:59:10.657346Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.05818"},"observation_digest":"sha256:43699aaa51e48e27574102b79e1a0aa21460d2985649a237cd05055f53891a24","observation_id":"c2268b87-e105-467f-8943-9fa41c8db29b","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.08461","last_updated":"2026-04-09T16:57:11Z","snapshot_observed_at":"2026-08-01T02:05:37.324082Z","submitted_at":"2026-04-09T16:57:11Z","title":"OVS-DINO: Open-Vocabulary Segmentation via Structure-Aligned SAM-DINO with Language Guidance","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-10T17:04:52.871199Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.08461"},"observation_digest":"sha256:efaf70486a8ca14944d5dfc762123a83af9b8efbecb34335beb46a3ccdd317a1","observation_id":"9a4b174d-15e8-4d43-9ff9-14b0352c9619","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.11487","last_updated":"2026-04-13T13:53:11Z","snapshot_observed_at":"2026-08-02T11:57:01.803037Z","submitted_at":"2026-04-13T13:53:11Z","title":"NTIRE 2026 Challenge on Robust AI-Generated Image Detection in the Wild","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-10T16:42:52.084288Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.11487"},"observation_digest":"sha256:f2b210f8846b63590232432827477de75cdf7bb28bad5fcff158119bbc01611a","observation_id":"824bfa98-3039-43a3-bdf5-cdc6419f28ce","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12012","last_updated":"2026-04-13T20:00:04Z","snapshot_observed_at":"2026-07-06T23:00:17.634307Z","submitted_at":"2026-04-13T20:00:04Z","title":"TIPSv2: Advancing Vision-Language Pretraining with Enhanced Patch-Text Alignment","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-10T16:00:12.466258Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12012"},"observation_digest":"sha256:5d0428a75bf6c5dcbd6c4e38a90a41e4c216c79b8e35ce3f45295f432a0b3364","observation_id":"f2ca36ba-bf71-4b66-99b2-967c260953f0","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12307","last_updated":"2026-04-14T05:35:32Z","snapshot_observed_at":"2026-07-06T23:00:32.607699Z","submitted_at":"2026-04-14T05:35:32Z","title":"Boosting Robust AIGI Detection with LoRA-based Pairwise Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:11.099966Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12307"},"observation_digest":"sha256:1a3bfccd25e2b793bcbed3cb5546faef71e766570e1c9eeaeb55d60861796c93","observation_id":"6b520045-579d-42f9-a8ca-fe98c2fbca43","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12391","last_updated":"2026-04-14T07:26:23Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T07:26:23Z","title":"Chain-of-Models Pre-Training: Rethinking Training Acceleration of Vision Foundation Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-10T16:16:51.109113Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12391"},"observation_digest":"sha256:4c46efaa3987703c74036dafb4e08f2a38c8554af49f9bac8763133861f775cb","observation_id":"e5545ba7-c333-444e-a0bb-55c4e3ec9a36","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12403","last_updated":"2026-04-14T07:39:03Z","snapshot_observed_at":"2026-08-02T03:50:32.283569Z","submitted_at":"2026-04-14T07:39:03Z","title":"Dual-Modality Anchor-Guided Filtering for Test-time Prompt Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-10T16:11:42.935453Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12403"},"observation_digest":"sha256:22fc4aed349b6910dd03f21200a169f74cf57b5422950436af9cc778ef6f00fc","observation_id":"dfdbe15f-615a-485a-b799-a6975a1d15ff","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12551","last_updated":"2026-04-14T10:25:32Z","snapshot_observed_at":"2026-08-02T17:29:05.835775Z","submitted_at":"2026-04-14T10:25:32Z","title":"Cross-Attentive Multiview Fusion of Vision-Language Embeddings","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T14:56:08.616492Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12551"},"observation_digest":"sha256:ddeec010113d4a3946b0e803da802d6957433cf86cd8b40d46b480f8e5e157f7","observation_id":"9140e422-ebbd-4ccd-82a1-c3fed2d59e3c","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.12833","last_updated":"2026-04-14T14:52:15Z","snapshot_observed_at":"2026-07-06T23:00:56.449281Z","submitted_at":"2026-04-14T14:52:15Z","title":"Challenging Vision-Language Models with Physically Deployable Multimodal Semantic Lighting Attacks","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-10T15:58:28.202606Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.12833"},"observation_digest":"sha256:b2cf9ed54912edcf4aa61f287d653028ff4cb8d8940cdbc23ebeb36b88fb3368","observation_id":"9726290c-7a77-4a8b-9ace-ed0bf7ed6695","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.20135","last_updated":"2026-04-22T03:02:21Z","snapshot_observed_at":"2026-07-06T23:06:40.154278Z","submitted_at":"2026-04-22T03:02:21Z","title":"AFMRL: Attribute-Enhanced Fine-Grained Multi-Modal Representation Learning in E-commerce","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T00:55:56.146885Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.20135"},"observation_digest":"sha256:6550b03e57a25a638bdcd0cb3340686642be6ac5640bd9b366931ca5d3f21c49","observation_id":"5aaf68ef-9c46-437b-80c0-7e92ad3c1716","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.20760","last_updated":"2026-04-22T16:48:43Z","snapshot_observed_at":"2026-08-04T10:29:14.353844Z","submitted_at":"2026-04-22T16:48:43Z","title":"Exploring High-Order Self-Similarity for Video Understanding","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-10T00:59:03.890135Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.20760"},"observation_digest":"sha256:5bc6a87d8196fd110bb766efc2c655287c3ce29ba6b9189dac25cb7c817dab33","observation_id":"cf904e8c-3cd1-404b-9a84-f73290ee5a9c","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.21326","last_updated":"2026-04-23T06:29:42Z","snapshot_observed_at":"2026-07-06T23:07:56.487654Z","submitted_at":"2026-04-23T06:29:42Z","title":"MiMIC: Mitigating Visual Modality Collapse in Universal Multimodal Retrieval While Avoiding Semantic Misalignment","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-09T21:56:38.004300Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.21326"},"observation_digest":"sha256:91956e28f247e006027f1a34bd3581851b76965cd57269fd6e5c06226df96fc8","observation_id":"b8bb0c24-34a2-4d37-8e17-fc7fd19f2d15","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.21475","last_updated":"2026-06-20T18:31:05Z","snapshot_observed_at":"2026-08-04T18:37:57.415016Z","submitted_at":"2026-04-23T09:33:38Z","title":"Photonic Quantum Computing on Spin Memory Architecture with Tree-Encoded Fusion","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-05T01:15:04.990410Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.21475"},"observation_digest":"sha256:cf3512b2f4d7f832a57fdd09a56722e86ab4c9fa629cd7c4f5b891a021af2b54","observation_id":"090bac04-f443-40d8-b78c-0b9efe46087e","resolution":{"observed_at":"2026-07-05T01:20:37.312658Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.21478","last_updated":"2026-04-23T09:39:33Z","snapshot_observed_at":"2026-08-02T11:40:57.706331Z","submitted_at":"2026-04-23T09:39:33Z","title":"Rethinking Cross-Domain Evaluation for Face Forgery Detection with Semantic Fine-grained Alignment and Mixture-of-Experts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-09T21:46:18.489180Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.21478"},"observation_digest":"sha256:b9a174d9b938179c49dcaf8d7cba9ca0bd5750f53ca5d9ee21bf6e5434e1afc5","observation_id":"21cd8b1a-969a-458e-b020-72f2f5d7dfe3","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.22678","last_updated":"2026-04-24T16:01:19Z","snapshot_observed_at":"2026-08-02T23:34:29.041136Z","submitted_at":"2026-04-24T16:01:19Z","title":"BERAG: Bayesian Ensemble Retrieval-Augmented Generation for Knowledge-based Visual Question Answering","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-08T11:37:20.118862Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.22678"},"observation_digest":"sha256:05e5632721416023a2d645e257129ecd13d745fa99404fc0440873acbc342586","observation_id":"e4614da5-a0ba-4aa0-8fe8-2fd7dd6a43f8","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.23344","last_updated":"2026-04-25T15:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-25T15:06:07Z","title":"Exploring Hierarchical Consistency and Unbiased Objectness for Open-Vocabulary Object Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-08T08:41:12.351655Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.23344"},"observation_digest":"sha256:f7fef4365123d13af4dd532972abdc380ea363660559a9de06361129af409a57","observation_id":"0af2a0bb-f1cc-4ab7-9b39-fce5a616ce30","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2604.24642","last_updated":"2026-04-27T16:10:00Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T16:10:00Z","title":"Probing CLIP's Comprehension of 360-Degree Textual and Visual Semantics","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T04:25:58.275705Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2604.24642"},"observation_digest":"sha256:0f036424866de4e004ffbb9a1ebb3e3a93c5e6b56495943eb2ec69df01ca348e","observation_id":"c9532299-39dc-434d-8e4f-e4eb38db7505","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.04777","last_updated":"2026-05-06T11:30:21Z","snapshot_observed_at":"2026-07-06T23:17:28.583202Z","submitted_at":"2026-05-06T11:30:21Z","title":"Bridging Perception and Action: A Lightweight Multimodal Meta-Planner Framework for Robust Earth Observation Agents","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-08T15:45:27.700503Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.04777"},"observation_digest":"sha256:8e03d84a513543c498d8e9ece36aca3a8d372763e0d3cb5ab2eae114cbf36766","observation_id":"63c4e5bf-2640-455c-bb60-6d58b17f7ee6","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-12T01:28:48.722301Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:387b29b9329d3dafacd525a21f3b17df15f01112d7b1c83134b6e298b77da96a","observation_id":"97d78bb7-9df8-40fb-b21d-8f6ddf0cef5a","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T06:57:25.015358Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:8333ac83a700064cb6a42345d76d07fe000cefacc3dc6428eb69186f8c5d6b47","observation_id":"c9b6b835-4073-45d7-b2b8-b274ab0e0209","resolution":{"observed_at":"2026-05-13T07:02:27.788287Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.08384","last_updated":"2026-06-05T21:57:48Z","snapshot_observed_at":"2026-08-02T16:50:30.597437Z","submitted_at":"2026-05-08T18:45:15Z","title":"jina-embeddings-v5-omni: Geometry-preserving Embeddings via Locked Aligned Towers","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T22:56:43.298141Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.08384"},"observation_digest":"sha256:010b33cccb727d8a44b2e8956476dfcf7ace8ef34ffff0596692654f16bfce2b","observation_id":"bce4d147-995c-4704-bbab-934d62077473","resolution":{"observed_at":"2026-07-01T13:35:46.694857Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.08985","last_updated":"2026-05-09T15:10:26Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T15:10:26Z","title":"LLaVA-UHD v4: What Makes Efficient Visual Encoding in MLLMs?","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-12T02:06:45.858231Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.08985"},"observation_digest":"sha256:08217119bba51ec9e54567959346cdda6b449c4835f9370395efc72d8d5c584f","observation_id":"6f2a0980-4fe0-43ec-a40c-19e1f347e0b8","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.10157","last_updated":"2026-05-11T08:05:18Z","snapshot_observed_at":"2026-07-06T23:22:08.560919Z","submitted_at":"2026-05-11T08:05:18Z","title":"MolSight: Molecular Property Prediction with Images","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-12T04:05:21.133255Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.10157"},"observation_digest":"sha256:3d5fd25c042a3c323843def97c9506ca6cee35a3a5d4f58b277af445421470f4","observation_id":"45991b55-7280-4c1b-a614-91ef1c61d32a","resolution":{"observed_at":"2026-05-13T01:54:22.133331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"reference_index":118,"source":"pdf_text","source_observed_at":"2026-05-13T05:12:37.339084Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.12500"},"observation_digest":"sha256:a3e4356a85e8589ec0cbdca36e19eb3239fe4c2a02c0213e75e0e1228e9e889c","observation_id":"b2353877-f168-44ca-8daf-8701b3c72e0a","resolution":{"observed_at":"2026-05-13T05:17:18.640200Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.12905","last_updated":"2026-05-13T02:31:10Z","snapshot_observed_at":"2026-08-01T22:11:44.606833Z","submitted_at":"2026-05-13T02:31:10Z","title":"Same Image, Different Meanings: Toward Retrieval of Context-Dependent Meanings","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-14T18:52:29.268016Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.12905"},"observation_digest":"sha256:33b4ec15d44a8feb811b6efe12b2d2890a17020c6cbbfbf063b27966edaebf53","observation_id":"6f653ca6-00a1-4094-95d5-0f989c5e488f","resolution":{"observed_at":"2026-05-14T18:52:35.402683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.13080","last_updated":"2026-05-13T06:54:09Z","snapshot_observed_at":"2026-08-02T12:36:41.415898Z","submitted_at":"2026-05-13T06:54:09Z","title":"Learning to See What You Need: Gaze Attention for Multimodal Large Language Models","version":1},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-14T20:13:18.813131Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.13080"},"observation_digest":"sha256:3421576a29c890f33d5b5939bf8ee73bc0e9ea21ff585edfe50b55ca5db5e778","observation_id":"a44a9293-ed48-415e-ab13-e7ba2a6cfea1","resolution":{"observed_at":"2026-05-14T20:22:56.360040Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.13352","last_updated":"2026-08-01T21:51:11Z","snapshot_observed_at":"2026-08-06T06:12:30.511686Z","submitted_at":"2026-05-13T11:12:18Z","title":"GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-14T20:44:28.495239Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.13352"},"observation_digest":"sha256:99ad86832a42aaee814a389f136a641050e312af005316fb030b9496dc569513","observation_id":"456a6c23-89ab-43f7-8f8b-d4f795c52cab","resolution":{"observed_at":"2026-05-14T20:47:58.705426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-04T05:15:50.090130Z","title":"Eva-clip: Improved training techniques for clip at scale","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.13352","last_updated":"2026-08-01T21:51:11Z","snapshot_observed_at":"2026-08-06T06:12:30.511686Z","submitted_at":"2026-05-13T11:12:18Z","title":"GeoFlowVLM: Geometry-Aware Joint Uncertainty for Frozen Vision-Language Embedding","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T05:15:50.090130Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.13352"},"observation_digest":"sha256:ae31e872dc2e6657dd5eb50ab326ac073cb918bd4273c1b7fda11db7b6e3be42","observation_id":"d2a2bc53-784f-4f62-afa5-b8704c1bbe24","resolution":{"observed_at":"2026-08-04T05:15:50.090130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-01T14:26:50.736804Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-14T18:43:08.029165Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.13548"},"observation_digest":"sha256:7724fc96c488ecf647ae5019e97442642bce039bc3a57d3731ae13d91ccddb80","observation_id":"4ff4f497-ab03-4cb1-b11d-9b5270e59472","resolution":{"observed_at":"2026-05-14T18:47:37.151940Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2605.13548","last_updated":"2026-06-01T10:46:32Z","snapshot_observed_at":"2026-08-01T14:26:50.736804Z","submitted_at":"2026-05-13T13:55:37Z","title":"AttenA+: Rectifying Action Inequality in Robotic Foundation Models","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T21:42:05.592911Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2605.13548"},"observation_digest":"sha256:457a5345aecf1548cab1fa0e66554b8eb1f2e30fe195c51952feb25e531905ec","observation_id":"5c614f5c-af61-4ca5-a05f-db660ab649af","resolution":{"observed_at":"2026-06-30T21:45:05.683078Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2303.15389/citation-record","integrity":"/paper/2303.15389/integrity","json":"/paper/2303.15389/citation-record.json","paper":"/paper/2303.15389"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://laion.ai/blog/giant-openclip/","venue":null,"work_id":"397cdab5-c78c-4464-947d-a8015ccddb8c","year":null},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:9b4a757cff618396c10b4842429bc24f57f6d3e48a6f3385f3901245996286f2","observation_id":"5d4ac27b-e57c-4063-999b-dfd616550206","resolution":{"observed_at":"2026-05-13T01:54:22.129995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":"2106.08254","doi":"10.48550/arxiv.2106.08254","metadata_source":"pith","pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BEiT: BERT Pre-Training of Image Transformers","venue":"cs.CV","work_id":"d74eda3c-bf7e-45f1-a8f1-a0137ecca3f4","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:20a5960b664bbdae4c257f26d522d47bbc16b7a79d999442d4e3ea5afdcaa617","observation_id":"905cb502-ae4f-4887-ac92-39bcffaf06ff","resolution":{"observed_at":"2026-05-13T11:50:11.580126Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ob- jectnet: A large-scale bias-controlled dataset for pushing the limits of object recognition models","venue":null,"work_id":"39996506-9c46-4fc3-88ad-f2f46f2f25a5","year":2019},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:e95d14690feb8b94491a51a7629c6f8a1df5e3b62698c787542eee8156f717cc","observation_id":"47538e7b-3219-4811-a63f-f13c3d2dd47c","resolution":{"observed_at":"2026-05-13T01:54:22.102541Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Birdsnap: Large- 5 config EV A-01-CLIP-g / EV A-02-CLIP-g+ image enc","venue":null,"work_id":"f1c2a878-b555-4592-9b4c-5480522ff5ee","year":2014},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:d83e71c91022581ef0e7f516d9a0e0bb40cfecc340f6e84cba9bb2bd8302d079","observation_id":"84c86ebd-289e-49b5-a5f1-2bc66792c690","resolution":{"observed_at":"2026-05-13T01:54:22.105212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Food- 101–mining discriminative components with random forests","venue":null,"work_id":"4691f693-8753-4bb2-bf05-c9f571b59cc0","year":2014},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:eda178f7d5f8ee1fb2d46edf9a5ff937ae2a274b8a5ab5f4c82a96b38982d743","observation_id":"3be0339e-3f28-4a58-95f6-c2d4a21eb001","resolution":{"observed_at":"2026-05-13T01:54:22.108178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Coyo-700m: Image- text pair dataset","venue":null,"work_id":"17d3be78-9284-4168-8d84-ffb9ad91f8d7","year":2022},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:4106c4b0b24c8f1d7f2dd06ebd3e38fb8ecb0f29140453b4e4b26d29e63f60f5","observation_id":"3c713905-633c-42f9-9547-24cb2b680173","resolution":{"observed_at":"2026-05-13T01:54:22.110684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.01340","last_updated":"2018-08-03T20:17:05Z","snapshot_observed_at":"2026-07-06T06:54:00.483796Z","submitted_at":"2018-08-03T20:17:05Z","title":"A Short Note about Kinetics-600","version":1},"cited_work":{"arxiv_id":"1808.01340","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.01340","snapshot_observed_at":"2026-07-09T11:16:11.465544Z","title":"A Short Note about Kinetics-600","venue":"cs.CV","work_id":"851b1623-6feb-441e-8849-b07f1753f22e","year":2018},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/1808.01340","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:baab1554b6fd7e21a7fa6c97d7623bf18b6bc491ad90e7dd52e31b784345cb6f","observation_id":"9227a8ef-d6a0-4d3c-9757-84e1b04262e7","resolution":{"observed_at":"2026-05-13T01:54:21.979398Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.06987","last_updated":"2022-10-17T19:58:40Z","snapshot_observed_at":"2026-07-06T08:08:03.081236Z","submitted_at":"2019-07-15T12:58:21Z","title":"A Short Note on the Kinetics-700 Human Action Dataset","version":2},"cited_work":{"arxiv_id":"1907.06987","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.06987","snapshot_observed_at":"2026-07-04T09:49:44.399575Z","title":"A short note on the kinetics- 700 human action dataset","venue":null,"work_id":"6eaebe96-5819-4220-84d5-dd888c79b8f4","year":1907},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/1907.06987","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:27e112e115d7d15c89bfc59e8588614b673603c9c4cd3019c4dae5852bedbb75","observation_id":"40df6e5f-c463-4583-b6c4-1466c3d0c92a","resolution":{"observed_at":"2026-05-13T01:54:21.983170Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quo vadis, action recogni- tion? a new model and the kinetics dataset","venue":null,"work_id":"07baa2df-63b3-4784-a94f-96fe4fcf5796","year":2017},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:659d9a01fc6436f84c518539003eb773ea38cb05505fb9f3593cfdecfcc2928c","observation_id":"3847e30a-d5d1-4bb2-803f-4f612dcd4e8a","resolution":{"observed_at":"2026-05-13T01:54:22.119266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Train- ing deep nets with sublinear memory cost","venue":null,"work_id":"558b6525-e829-4328-8af4-6588cd5b679b","year":2016},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:c0bf787fabd7626b62ca80f78e40dcc0fb776cce4504390ef17d442971a2b513","observation_id":"c06272bf-e3a1-4305-bfd0-89ea29a742b7","resolution":{"observed_at":"2026-05-13T01:54:22.121938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Remote sensing im- age scene classification: Benchmark and state of the art","venue":null,"work_id":"83cde467-440b-4a14-888b-2945a76f5f7b","year":2017},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:c09c6645ec10663c4419b04b80d91d35e90979ef214c7a4fb2b92977158e9595","observation_id":"3e0c82d9-1ca8-4a33-a341-5cf5fb20c7b0","resolution":{"observed_at":"2026-05-13T01:54:22.124613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cimpoi, S","venue":null,"work_id":"62b096ca-7b0e-40da-8bf7-06ff440feaf9","year":2014},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:212f2bdbba69b7606e2416d2329c92ec063acf3f3f9e25e5ce7a5823f0532a01","observation_id":"2f2bd24a-7cf9-41b1-84e6-3b6d0e2f7775","resolution":{"observed_at":"2026-05-13T01:54:22.127191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10555","last_updated":"2020-03-23T21:17:42Z","snapshot_observed_at":"2026-07-06T09:06:50.593178Z","submitted_at":"2020-03-23T21:17:42Z","title":"ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators","version":1},"cited_work":{"arxiv_id":"2003.10555","doi":"10.48550/arxiv.2003.10555","metadata_source":"pith","pith_arxiv_id":"2003.10555","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators","venue":"cs.CL","work_id":"82ddcaa7-a02b-4cba-9c4f-949f522684d5","year":2020},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2003.10555","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:b8613e0b60a7b0b9f9bc2988ef8feb8fb55d7f4d1cd3418014ca09375b06e538","observation_id":"8929ef37-d1b6-4a04-8b9b-f0402469abd1","resolution":{"observed_at":"2026-05-16T10:26:47.677366Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An analysis of single- layer networks in unsupervised feature learning","venue":null,"work_id":"77f869a5-586f-43f0-9b10-8f19baf240b5","year":2011},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:5b1b9ad6257b63ad12e0603baa3cfc8ab6f5ebcc350327bbff03f9d5a42149a7","observation_id":"717a9c38-ba92-48d0-86f0-8dc0f1e20d74","resolution":{"observed_at":"2026-05-13T01:54:22.132329Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher R´e","venue":null,"work_id":"3254aea1-dcac-4c33-b60f-4b2e8b775b19","year":2022},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:a7616d2888e4aec0336695ac14a87340d280c18837d7f850d4712d5dc48071a9","observation_id":"d8d4586e-eca9-4adb-857f-349b281b601d","resolution":{"observed_at":"2026-05-13T01:54:22.028248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":"0baf718d-1516-4b0c-8e4b-a03db1f434dc","year":null},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:b298d057ea4135a86347fb2ff5de76f14d49b0d0e1f6210baaaa4ce01e043d16","observation_id":"6cfbdbf5-7aa9-4573-8694-628b8893427a","resolution":{"observed_at":"2026-05-13T01:54:22.030998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":"38a39785-a8f1-4bfd-9a48-1c8a5d4181e1","year":2020},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:50efc4572cbbccc47dde106d4d294c1a2de6899b4a555f5ec0d0533a0b686003","observation_id":"72644616-38fc-45fd-bedc-7a895f2b1e88","resolution":{"observed_at":"2026-05-13T01:54:22.033451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The pascal visual object classes challenge: A retrospective","venue":null,"work_id":"b71b0e16-6887-432e-b2d4-4c4c63c149fd","year":2015},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:df7b4de5e778888ca60a208cbe9db20440be05609d49c3ababe8b1f1a12e15d3","observation_id":"c77d9479-4b93-49f0-8659-f4903cc3dc19","resolution":{"observed_at":"2026-05-13T01:54:22.035899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11331","last_updated":"2023-03-22T14:10:37Z","snapshot_observed_at":"2026-08-04T19:06:24.411991Z","submitted_at":"2023-03-20T17:59:59Z","title":"EVA-02: A Visual Representation for Neon Genesis","version":2},"cited_work":{"arxiv_id":"2303.11331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.11331","snapshot_observed_at":"2026-07-05T11:41:02.797019Z","title":"Eva-02: A visual representation for neon genesis","venue":"cs.CV","work_id":"bf537885-a22b-4675-854f-7f42dfb687a7","year":2023},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2303.11331","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:df67205f15e6d3de11bf1e3c1ff1bff05008e7ac11118d2cce6fd1e74f14c1f0","observation_id":"e6073abb-c3e6-41e7-9142-55638d434202","resolution":{"observed_at":"2026-05-13T01:54:21.987206Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.07636","last_updated":"2022-12-05T13:53:51Z","snapshot_observed_at":"2026-07-06T14:18:10.647862Z","submitted_at":"2022-11-14T18:59:52Z","title":"EVA: Exploring the Limits of Masked Visual Representation Learning at Scale","version":2},"cited_work":{"arxiv_id":"2211.07636","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.07636","snapshot_observed_at":"2026-07-09T22:06:35.172946Z","title":"EV A: Exploring the Limits of Masked Visual Repre- sentation Learning at Scale 2022","venue":"cs.CV","work_id":"eade6cd6-163e-4159-a69b-346f76af0118","year":2022},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2211.07636","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:182658f7a766532c212778be75f4f4f3e423811fe56d89ac6e98c02d58d1dc51","observation_id":"4b240e77-6838-4723-a1a2-7770350f0f94","resolution":{"observed_at":"2026-05-13T01:54:21.991369Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning generative vi- sual models from few training examples: An incremental bayesian approach tested on 101 object categories","venue":null,"work_id":"4db03cbd-294d-41cd-956c-23ef430aeb79","year":2004},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:92090acd114f64ba1e642bf9ea62183039d1cf4a1b7a3000c08b4218239d6c19","observation_id":"e20181b7-f29b-458d-8159-f674dc8cb0a1","resolution":{"observed_at":"2026-05-13T01:54:22.044325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Challenges in repre- sentation learning: A report on three machine learning contests","venue":null,"work_id":"61dea3d2-cca6-4b47-b11e-89303ca39203","year":2013},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:92d44db0b1879dc778deafccb4c1ef4a95c8221d715075bbf0cc8fbc8446d554","observation_id":"0ce706aa-5ae4-4af5-8c40-090708f9b9a4","resolution":{"observed_at":"2026-05-13T01:54:22.047295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Eurosat: A novel dataset and deep learning benchmark for land use and land cover classification.IEEE J","venue":null,"work_id":"a316dfb9-e2b3-4645-b3ee-12327510f81c","year":2019},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:71fe46499e03d8975d4d459b7ff3726b12e79c462e1ff092d9a020e3add9a210","observation_id":"7058e54c-3bd3-4e16-95ea-db0cbdf8c405","resolution":{"observed_at":"2026-05-13T01:54:22.050108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The many faces of robustness: A critical analysis of out-of-distribution generalization","venue":null,"work_id":"b517fa0e-d259-427f-b81c-908fe902ff59","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:cbe25d4af5cf0795d575152c0095aea978c4dff51156d1ba5fde0fc19c3bb7d9","observation_id":"4ed2b2a1-72cb-4008-bdaa-7c97f5bb18d2","resolution":{"observed_at":"2026-05-13T01:54:22.052637Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural adversarial examples","venue":null,"work_id":"6e02e16e-811f-4353-b25d-afa4ecd32bb3","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:fe97ea87b5d85a560e910c43f072b1a7e963dbeadd101c29ac60bfd41d98b036","observation_id":"cc7ce154-af0c-4833-b404-32e89e3ff53c","resolution":{"observed_at":"2026-05-13T01:54:22.055045Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep networks with stochastic depth","venue":null,"work_id":"c44a179e-3401-4c83-9636-c05bcff0dbb1","year":2016},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:6a7d530ca5f3ae3ac66040b67017869179a8a3ad6385f48901a3012729b658b3","observation_id":"68a7f5ce-8d31-450d-9300-2118792fe1cd","resolution":{"observed_at":"2026-05-13T01:54:22.057627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openclip","venue":null,"work_id":"22852cea-824d-4503-a230-aec661d739a3","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:fdd2876ceb8016f9469e533e4a00cc5fa6e4ab55bc92cc13c195bc011867747b","observation_id":"fc3cdfbf-a4a1-43fc-b352-bc6849e14b7c","resolution":{"observed_at":"2026-05-13T01:54:22.059793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:e55db949808f5bd6b5dfe051c12587dbbbc3a0033d7954d3a4b1c1982a5aabe7","observation_id":"b3fc2eed-9b09-4827-854a-056c7e6415a1","resolution":{"observed_at":"2026-05-13T01:54:21.994898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"3d object representations for fine-grained categorization","venue":null,"work_id":"0a91ada4-06f1-44ed-8fc3-49e5ea09b617","year":null},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:3fee8ba57ae917f567138616dd558b1aaf50712affbfa99dd5bc7964f94e7a67","observation_id":"4429f131-efeb-4bf8-8c68-07cd4f61083c","resolution":{"observed_at":"2026-05-13T01:54:22.065627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":"944cf8d0-9b5f-4f5c-9fe5-5a0120ec5a1d","year":2009},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:a401979d2cf8bf7b7c3b4d1885c2eee827e37904937f3eb1d6fd528f84e99f57","observation_id":"9a2d9850-3d62-46b4-8589-03158af307fd","resolution":{"observed_at":"2026-05-13T01:54:22.068005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gradient-based learning applied to document recognition.Proceed- ings of the IEEE","venue":null,"work_id":"775f4091-ac81-4dcc-9f5c-6d9990745cfb","year":1998},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:03c16822aadbe96b5629c5aaa07bd0fd024727bd6f52d989064f95f6fa8c03f6","observation_id":"86370879-fa09-42fe-9550-642faf874be0","resolution":{"observed_at":"2026-05-13T01:54:22.070552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":"2301.12597","doi":"10.48550/arxiv.2301.12597","metadata_source":"pith","pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","venue":"cs.CV","work_id":"63d03f4d-15f4-4583-8286-913c19f02294","year":2023},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:64b31aa56dbeb345b66da6701e11f5aa6a1016b62660572445d3ae865ba0a4c0","observation_id":"4157f1f2-ad2d-4c38-8bcc-eda18a0fd7fd","resolution":{"observed_at":"2026-05-13T01:54:21.999367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:47.354893+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling language-image pre-training via masking","venue":null,"work_id":"b0288649-6e17-432b-89bb-ab3d4b132374","year":null},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:e8ca33dced63d3eb11c3f8e8f942442d69db41d77e62178e61f66a105295d7c4","observation_id":"7fa97d15-8688-401f-b5b5-20dcf49962f8","resolution":{"observed_at":"2026-05-13T01:54:22.075790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mi- crosoft coco: Common objects in context","venue":null,"work_id":"58e6ae5d-0cd7-4018-beac-e4460276ab08","year":2014},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:328e166c3db3d320d33639f446b1813fab3055f88fd8f125b8c0d1a02e9354d6","observation_id":"dc571e50-a4b3-46d6-8ac1-2cc18354ea40","resolution":{"observed_at":"2026-05-13T01:54:22.078251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Decoupled weight decay regu- larization","venue":null,"work_id":"563235ef-7d6a-48bf-ae74-259f5bfde76f","year":2019},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:37787325206631080ce71962223c0cb3188fd2b8da9cc57beaccf294028b52f2","observation_id":"4dfa8e20-811f-45cd-92d3-6e833563521d","resolution":{"observed_at":"2026-05-13T01:54:22.081332Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1306.5151","last_updated":"2013-06-21T14:31:57Z","snapshot_observed_at":"2026-07-06T03:16:28.287173Z","submitted_at":"2013-06-21T14:31:57Z","title":"Fine-Grained Visual Classification of Aircraft","version":1},"cited_work":{"arxiv_id":"1306.5151","doi":null,"metadata_source":"pith","pith_arxiv_id":"1306.5151","snapshot_observed_at":"2026-07-11T03:07:53.092922Z","title":"Fine-Grained Visual Classification of Aircraft","venue":"cs.CV","work_id":"ed360110-3ce4-4959-8c74-1785cd9e537d","year":2013},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/1306.5151","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:735833271dafb3071a58fd8ca96ebb9910a984cdabdb7bc1ed7c2c11e9410ce3","observation_id":"585dcffc-9241-46b2-b18f-85bb2e2024be","resolution":{"observed_at":"2026-05-13T01:54:22.003522Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automated flower classification over a large number of classes","venue":null,"work_id":"f3681519-3a5d-4ac7-af32-4524212b626d","year":2008},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:ef400d6b9350e0071b0634857b33340cb079c6009cddcd211bd11bbc41aec6e8","observation_id":"1717ca60-b062-4b7f-8ee2-58923a460f94","resolution":{"observed_at":"2026-05-13T01:54:22.086632Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Parkhi, Andrea Vedaldi, Andrew Zisserman, and C","venue":null,"work_id":"bc40a04b-ed34-427f-9c8d-406a23c7745e","year":2012},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:9eea21996987d6028ee62a26a98f90edc565de2062c2fa6099c0bbee4164d617","observation_id":"4f03c5b8-54cc-4747-acdf-1c9d3e18005b","resolution":{"observed_at":"2026-05-13T01:54:22.089019Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":"1c88b5b2-c2d6-4639-bf1d-5e7eff4473dc","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:35536aa08d8a3e763e72475b925c636d867c8fc1a73870afbd5822f4bb4a2564","observation_id":"e8d43270-fa26-4155-9939-2e343b7b816b","resolution":{"observed_at":"2026-05-13T01:54:22.093328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"835445b9-c568-46a0-9edb-651efb365ca2","year":2020},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:12eda36766c0860b3b1b8681661c3b7665807837e58a713dded4a9c3229b9493","observation_id":"5e2d96f6-9869-40b7-9a61-86d87ea4d916","resolution":{"observed_at":"2026-05-13T01:54:22.096508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:262d798afc287f83e01d4931bc1bc0c0639dc6b8afec0f6c48ef21be69b6e9e9","observation_id":"38a04513-429b-44bd-8d97-2e2d7bda9b58","resolution":{"observed_at":"2026-05-13T01:54:22.007249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.12092","last_updated":"2021-02-26T23:26:05Z","snapshot_observed_at":"2026-07-06T10:44:09.403787Z","submitted_at":"2021-02-24T06:42:31Z","title":"Zero-Shot Text-to-Image Generation","version":2},"cited_work":{"arxiv_id":"2102.12092","doi":"10.48550/arxiv.2102.12092","metadata_source":"pith","pith_arxiv_id":"2102.12092","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-Shot Text-to-Image Generation","venue":"cs.CV","work_id":"b687fcea-fa95-4504-9ab2-8a627cae0000","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2102.12092","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:f2af47fe6d439964156bcbb75baa61a9ff77dc37d532d065f5b2dde714e7c1cc","observation_id":"8197d098-652e-44a6-945c-8404abe851bb","resolution":{"observed_at":"2026-05-13T22:26:09.277502Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimizations enable training deep learn- ing models with over 100 billion parameters","venue":null,"work_id":"93608f0b-1bda-4732-8c49-42613c3acf32","year":2020},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:d632b675c1f8a20d1f8b00a88287389c2b1892dee739f0b6a1981add9d1282b6","observation_id":"e833415e-e83a-40c0-9403-c017d844f0b1","resolution":{"observed_at":"2026-05-13T01:54:22.116495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Do imagenet classifiers generalize to imagenet?","venue":null,"work_id":"a57001b7-a5b9-4abd-a4a7-1cbd5edd12b9","year":2019},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:c87b77d3296d4693ebbc309f43134c1e6e0b7fbefc97d1f7df501511c7cacff4","observation_id":"24cbce26-2a3c-4a63-8a39-b3c00860d10f","resolution":{"observed_at":"2026-05-13T01:54:22.038407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.08402","last_updated":"2022-10-16T00:08:18Z","snapshot_observed_at":"2026-07-29T21:51:47.064287Z","submitted_at":"2022-10-16T00:08:18Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","version":1},"cited_work":{"arxiv_id":"2210.08402","doi":"10.48550/arxiv.2210.08402","metadata_source":"pith","pith_arxiv_id":"2210.08402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-5B: An open large-scale dataset for training next generation image-text models","venue":"cs.CV","work_id":"1d19deb4-3043-409d-b901-f047c51a323b","year":2022},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2210.08402","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:da12e373b63695980f00ab0ac7a5d0f9df71fd590b5fe4d7683eaa7423558a8d","observation_id":"a5ecfb2e-8233-4f49-be7d-837cd80cfe14","resolution":{"observed_at":"2026-05-13T14:22:17.864689Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":"2111.02114","doi":"10.48550/arxiv.2111.02114","metadata_source":"pith","pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","venue":"cs.CV","work_id":"fbf16034-512e-4dd9-a0bd-7ddd23f532a6","year":2021},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:e1719106b0a75bb4c436131dc223235fb71d91fa80bad14d29cbee15e1669c2b","observation_id":"beddd684-84b6-4f4c-a0b7-0a12b308952f","resolution":{"observed_at":"2026-05-13T01:54:22.020140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T16:25:40.426779+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1212.0402","last_updated":"2012-12-03T14:45:31Z","snapshot_observed_at":"2026-07-06T03:01:10.229407Z","submitted_at":"2012-12-03T14:45:31Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","version":1},"cited_work":{"arxiv_id":"1212.0402","doi":"10.48550/arxiv.1212.0402","metadata_source":"pith","pith_arxiv_id":"1212.0402","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"UCF101: A Dataset of 101 Human Actions Classes From Videos in The Wild","venue":"cs.CV","work_id":"5dfb46e7-e952-409d-a3c7-ba7f20aebad6","year":2012},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"cited_paper":"/paper/1212.0402","citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:f3fb4af79064df6a44c3c673d7c8fc83a84aaccea56e4f07324427f1d23b7a9f","observation_id":"84b45e81-4f67-413c-9e81-f7a43c26b1b4","resolution":{"observed_at":"2026-05-13T01:54:22.024159Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e08b2d89-ba40-402d-bcb8-829c749453fe","year":2012},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:b9cb32950780bebe73654b6434bdebf56d6d76ef2e6ba0b7a85a841225e553c0","observation_id":"0aac5f7d-690a-4287-87f5-ec929279514f","resolution":{"observed_at":"2026-05-13T01:54:22.083782Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rotation equivariant cnns for digital pathology","venue":null,"work_id":"3abcb673-0132-43e0-87b1-95b4d0e65a0b","year":2018},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:287daeb87b9c083c71e4d435c85874f97de24f49a5cbd81be6b0a73737e03066","observation_id":"7d9c10ab-a031-40cc-8064-8973b00ecbac","resolution":{"observed_at":"2026-05-13T01:54:22.099465Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning robust global representations by penalizing local predic- tive power","venue":null,"work_id":"24045977-2348-4fd2-b4c3-f43772bd59b5","year":2019},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:816eaa4f2adf9874318b7d09d5d99e093b99a68831336986686bddeb9b3eb8a4","observation_id":"93db47bd-4d8a-4d1c-a88a-11671c53c8c5","resolution":{"observed_at":"2026-05-13T01:54:22.113561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sun database: Large-scale scene recognition from abbey to zoo","venue":null,"work_id":"4850501f-4bf9-4806-a5d9-f78b2097a72a","year":2010},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:aabeb8117fea7fc740718e93f48f56a6744415c1cf36ad28379cca2b281e1707","observation_id":"3e5eb02c-88a3-4689-bc21-19da9493582b","resolution":{"observed_at":"2026-05-13T01:54:22.041452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":"f10b4d4d-4c0b-4493-a78d-175f62c6de1c","year":2019},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:b0299b04040871f9f79cd4c3941abe77d17085a7b03fb556af797c9812ee9228","observation_id":"fbc6978b-0bef-4c9e-8c7e-b508f0ff55e1","resolution":{"observed_at":"2026-05-13T01:54:22.062575Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"From image descriptions to visual denotations: New similarity met- rics for semantic inference over event descriptions","venue":null,"work_id":"4cd0421a-b296-4c66-996e-003e29d0956a","year":2014},"citing_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T01:54:21.943160Z"},"links":{"citing_paper":"/paper/2303.15389"},"observation_digest":"sha256:651fd78d567487d1fd3da56d971d02a1b4ef33bd02c5fd9e111a7a1f782439a1","observation_id":"094735e7-f008-43ea-90a5-b0ef0af9bcb5","resolution":{"observed_at":"2026-05-13T01:54:22.073193Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":1,"verified_exact":14,"verified_fuzzy":38},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 100 inbound Pith citation observations for arXiv:2303.15389."}