{"as_of":"2026-08-06T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6cb83efdc00f21d2f1340d627d19f1f113b7b579474ba51541690bfa395b488e","coverage":[{"denominator":37,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":37,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T20:54:48.203293Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:48:51.126553Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.19584","snapshot_observed_at":"2026-08-04T14:48:51.126553Z","title":"arXiv preprint arXiv:2606.19584 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02124","last_updated":"2026-08-03T12:15:33Z","snapshot_observed_at":"2026-08-06T20:37:52.784624Z","submitted_at":"2026-08-03T12:15:33Z","title":"HAFI-VLM: A Frequency Perspective for Diagnosing and Enhancing Visual Perception in Vision-Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T14:48:51.126553Z"},"links":{"cited_paper":"/paper/2606.19584","citing_paper":"/paper/2608.02124"},"observation_digest":"sha256:b31b471253ca00f71a45136e6060f4eed8af8b7271469035d014324fb10dfada","observation_id":"bfdd4eff-2c2d-400e-bbbe-6f7e1f2e63ef","resolution":{"observed_at":"2026-08-04T14:48:51.126553Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2606.19584/citation-record","integrity":"/paper/2606.19584/integrity","json":"/paper/2606.19584/citation-record.json","paper":"/paper/2606.19584"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2203.17274","last_updated":"2022-06-03T17:52:04Z","snapshot_observed_at":"2026-07-06T12:55:27.843060Z","submitted_at":"2022-03-31T17:59:30Z","title":"Exploring Visual Prompts for Adapting Large-Scale Models","version":2},"cited_work":{"arxiv_id":"2203.17274","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2203.17274","snapshot_observed_at":"2026-07-04T00:49:19.216124Z","title":"Visual prompting: Modifying pixel space to adapt pre-trained models","venue":null,"work_id":"da285965-ebf5-410b-beaf-17ba49e67f3d","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2203.17274","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:5f6ff2063af90793a0173c1d50060ee14c3a19d6bd61c7db62fb6bbfcd4a318b","observation_id":"b409a6b4-2b1c-469c-a19c-41e9306614ba","resolution":{"observed_at":"2026-07-04T00:49:19.219783Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":"2407.07726","doi":"10.48550/arxiv.2407.07726","metadata_source":"pith","pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PaliGemma: A versatile 3B VLM for transfer","venue":"cs.CV","work_id":"df6f48b3-5792-47c7-9614-cb856ea31ad9","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:0b1a2b606500eb7cea20dd2cb1955cb0e21ab4e7b49f1220d09f3d946d0d7aff","observation_id":"4d801b32-0b86-45eb-a176-91299175cc09","resolution":{"observed_at":"2026-07-04T00:49:19.235400Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:31.538292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01883","last_updated":"2022-05-04T04:09:23Z","snapshot_observed_at":"2026-08-04T23:08:16.155726Z","submitted_at":"2022-05-04T04:09:23Z","title":"All You May Need for VQA are Image Captions","version":1},"cited_work":{"arxiv_id":"2205.01883","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2205.01883","snapshot_observed_at":"2026-07-04T00:49:19.179579Z","title":"Chen, M., Tworek, J., Jun, H., Yuan, Q., Pinto, H","venue":null,"work_id":"9d6e4be6-a94f-464a-9061-a8e316ae711b","year":null},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2205.01883","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:dc8cff6330c0fe93441043635203e2facfee8e8373ae5b3c2a210dc19fc5dcc5","observation_id":"f65f8726-a036-4254-9f67-75bccbe48d5f","resolution":{"observed_at":"2026-07-04T00:49:19.182325Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06794","last_updated":"2023-06-05T17:55:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-14T17:24:07Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","version":4},"cited_work":{"arxiv_id":"2209.06794","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06794","snapshot_observed_at":"2026-07-04T19:30:07.491958Z","title":"PaLI: A Jointly-Scaled Multilingual Language-Image Model","venue":"cs.CV","work_id":"29921cff-29c1-4aad-a27d-adac346027ec","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2209.06794","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:af2416c2f99eb42d7c43b9f4ae9e6913ba72371c41dd87a5a467256d242fd4c4","observation_id":"04765852-f0e7-47bf-a8a0-0e3d3f4d71f5","resolution":{"observed_at":"2026-07-04T00:49:19.151225Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:9b966966eced0bb9aa045920f4e74c7c55f66418e8f99a406c1d4bb6cc1e0c13","observation_id":"af8d776a-b5dc-4e54-93ff-56c205391feb","resolution":{"observed_at":"2026-07-04T00:49:19.186065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.Advances in neural information processing systems, 36:49250–49267,","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:6224b0d16f7f276ae7d42232286c72cbb969ffc047e51793fc5b383ce8861146","observation_id":"fe8d1ff0-b339-427f-a452-b870f0b87148","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04193","last_updated":"2024-03-10T01:55:47Z","snapshot_observed_at":"2026-08-02T00:46:07.834364Z","submitted_at":"2023-11-07T18:34:02Z","title":"Selective Visual Representations Improve Convergence and Generalization for Embodied AI","version":2},"cited_work":{"arxiv_id":"2311.04193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2311.04193","snapshot_observed_at":"2026-07-04T00:49:19.228025Z","title":"Selective visual representations improve convergence and generalization for embodied ai","venue":null,"work_id":"3f7f82f4-f12b-43fc-9173-06255d095cb8","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2311.04193","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:c06290318397160ce96afb7ac0f1d7a89f6a4ab41bb6dbc13fc4f2c2e78a3c0f","observation_id":"d0a11f6c-9b33-4edd-a4bf-3dbaede5828b","resolution":{"observed_at":"2026-07-04T00:49:19.230707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":"2309.17425","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-07-04T20:50:12.674098Z","title":"arXiv preprint arXiv:2309.17425 (2023)","venue":null,"work_id":"9922937e-9c54-4233-8816-d729dfaf746e","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:c1d23e909e74b8a55e0c7b07c2dc4b8abed0f6cd28cb4dff80c5a2708bd96aa0","observation_id":"74603111-ced3-4d18-9828-7fd57917637a","resolution":{"observed_at":"2026-07-04T00:49:19.225762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":"2407.21783","doi":"10.1016/s0749-0720(15","metadata_source":"pith","pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Llama 3 Herd of Models","venue":"cs.AI","work_id":"1549a635-88af-4ac1-acfe-51ae7bb53345","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:88f3c59b30eb3d1eaf1582651a779f292a3168aa5b87740fe80a9941a3f25987","observation_id":"d0b878aa-956d-45f4-8003-365ac9d3cd15","resolution":{"observed_at":"2026-07-04T00:49:19.239610Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12580","last_updated":"2024-07-17T14:04:12Z","snapshot_observed_at":"2026-08-05T07:40:31.916436Z","submitted_at":"2024-07-17T14:04:12Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2407.12580","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.12580","snapshot_observed_at":"2026-07-08T20:35:34.387006Z","title":"E5-V: Universal Embeddings with Multimodal Large Language Models","venue":"cs.CL","work_id":"df2e178e-bd96-48f4-8431-51c61fbc63fd","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.12580","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:f9424cbcbe68d019c464a61bc6e1abf88ca241d399bcc9be9c26bff77ce32a8a","observation_id":"500065c9-714e-448b-823f-4fa100ce157f","resolution":{"observed_at":"2026-07-04T00:49:19.214012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Referitgame: Referring to objects in photographs of natural scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:36178984cc5c64aa0731098a83b21b99fbe756b1449229bdb04e495ce2de60ff","observation_id":"0f3e7447-3d28-4bdd-bc44-5b2744a5d4ff","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00740","last_updated":"2025-03-29T12:57:07Z","snapshot_observed_at":"2026-07-06T18:08:21.770341Z","submitted_at":"2024-04-30T01:19:18Z","title":"Modeling Caption Diversity in Contrastive Vision-Language Pretraining","version":4},"cited_work":{"arxiv_id":"2405.00740","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.00740","snapshot_observed_at":"2026-07-04T00:49:19.200456Z","title":"Modeling caption diversity in contrastive vision-language pretraining.arXiv preprint arXiv:2405.00740,","venue":null,"work_id":"f1f68f83-c1c3-4b18-8112-7551c2453e3f","year":null},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2405.00740","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:9e95607d733c72472bbd1deefa6e4780398b874fb49f1005f7e2d96df95febd1","observation_id":"2f15f18c-c861-4fad-bd23-32145fe9126d","resolution":{"observed_at":"2026-07-04T00:49:19.203184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Vx2text: End-to-end learning of video-based text generation from multimodal inputs","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:6403528763b758a82549d31d42f792d814ef234a39d9dff6d10565a5fc47cd28","observation_id":"eb94859a-361c-4f75-bf42-d1c570f5915a","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Training-free deep concept injection enables language models for video question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:899ced4d7f9ea5c2f4d286fdf9b9d3f67aed7a1a5b907b5b02880157615a93e0","observation_id":"db8e253e-c488-4afd-b7a7-b04411b59a66","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07016","last_updated":"2023-04-21T17:08:27Z","snapshot_observed_at":"2026-08-02T07:43:21.690977Z","submitted_at":"2022-12-14T04:08:56Z","title":"Understanding Zero-Shot Adversarial Robustness for Large-Scale Models","version":2},"cited_work":{"arxiv_id":"2212.07016","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.07016","snapshot_observed_at":"2026-07-04T00:49:19.205616Z","title":"Understanding zero-shot adversarial robustness for large-scale models","venue":null,"work_id":"056afba7-1521-4a1f-ba45-99a26390b294","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2212.07016","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:3753b37878c42e94a31c7b4a56125bcc262fdb1f796498534b480c7de5c0663d","observation_id":"24da8478-d867-4092-ad40-ec9f08a7b5fd","resolution":{"observed_at":"2026-07-04T00:49:19.208818Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07183","last_updated":"2022-12-01T17:38:37Z","snapshot_observed_at":"2026-08-06T03:16:51.796129Z","submitted_at":"2022-10-13T17:03:46Z","title":"Visual Classification via Description from Large Language Models","version":2},"cited_work":{"arxiv_id":"2210.07183","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2210.07183","snapshot_observed_at":"2026-07-04T21:00:08.502290Z","title":"Visual Classiﬁcation via Description from Large Language Models, Dec","venue":null,"work_id":"f4d7d889-755e-4932-871a-c5a2d3a50b92","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2210.07183","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:038c8f0e1693903764629cc4fee8952faf0e2634a0a8bfb4128ae35ec4442259","observation_id":"075770d9-5c3b-40e0-99be-b6180696ee69","resolution":{"observed_at":"2026-07-04T00:49:19.244441Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04412","last_updated":"2022-12-08T17:10:31Z","snapshot_observed_at":"2026-07-06T14:28:25.630901Z","submitted_at":"2022-12-08T17:10:31Z","title":"Task Bias in Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2212.04412","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.04412","snapshot_observed_at":"2026-07-04T00:49:19.261510Z","title":"Task bias in vision-language models","venue":null,"work_id":"cd095483-03ae-4b76-bd2e-051a2a09cacc","year":null},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2212.04412","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:d78b67cab188671b3cf2256cd3f8886a36d6cd7a6a8226bfa09a6bc704dc22c5","observation_id":"39dc97ab-cd15-4c86-b94d-147a7176662e","resolution":{"observed_at":"2026-07-04T00:49:19.264204Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-08-06T05:58:29.182448Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":"2304.07193","doi":"10.48550/arxiv.2304.07193","metadata_source":"pith","pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINOv2: Learning Robust Visual Features without Supervision","venue":"cs.CV","work_id":"26b304e5-b54a-4f26-be7e-83299eca52e4","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:e85c2ad18699b351b1e23040bcbd2438793b722fa46c43c40ee71e0ce0c2deb7","observation_id":"0ed28888-7932-4c8c-af28-f5be5c797b1d","resolution":{"observed_at":"2026-07-04T00:49:19.186873Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.04372","last_updated":"2022-09-09T16:11:11Z","snapshot_observed_at":"2026-07-06T13:50:37.836182Z","submitted_at":"2022-09-09T16:11:11Z","title":"Pre-training image-language transformers for open-vocabulary tasks","version":1},"cited_work":{"arxiv_id":"2209.04372","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2209.04372","snapshot_observed_at":"2026-07-04T00:49:19.209105Z","title":"Piergiovanni, W","venue":null,"work_id":"5912d9b2-6b92-47a1-933f-9685abc0e263","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2209.04372","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:7741e34bb5515592f1eba6e3a54c50b729b28f9aad8c259c59c9aa23d2b94d9d","observation_id":"b09248ad-332a-46dc-94bf-8d04a110f576","resolution":{"observed_at":"2026-07-04T00:49:19.212641Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-07-06T15:08:34.018146Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":"2303.15389","doi":"10.48550/arxiv.2303.15389","metadata_source":"pith","pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","venue":"cs.CV","work_id":"0c16c250-fd0f-446a-bbb0-ea8dd0ba5ccd","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:9230982546d776151e28c65525b0c6fd1b6c6bf33d4d71b203e57adb8a1070c5","observation_id":"67f47f13-970e-4356-a8aa-cecdc6daa478","resolution":{"observed_at":"2026-07-04T00:49:19.177192Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.13851","last_updated":"2024-07-18T18:39:54Z","snapshot_observed_at":"2026-07-06T18:48:42.015848Z","submitted_at":"2024-07-18T18:39:54Z","title":"X-Former: Unifying Contrastive and Reconstruction Learning for MLLMs","version":1},"cited_work":{"arxiv_id":"2407.13851","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.13851","snapshot_observed_at":"2026-07-04T00:49:19.163396Z","title":"X-former: Unifying contrastive and reconstruction learning for mllms.arXiv preprint arXiv:2407.13851,","venue":null,"work_id":"9d239d5f-a242-4ad4-afd1-8067358bdc8e","year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2407.13851","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:648f9251a9f2001200252b0ede8c5396bc5c5af971f19bf5e69df9cc178b4fed","observation_id":"b75a33ca-9a94-4554-8f86-a03749aacd6a","resolution":{"observed_at":"2026-07-04T00:49:19.166875Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:af68bae4d70d686933563e9a93da7e77611337ed0848eba06c713391cea5c907","observation_id":"650ab919-5ed6-4535-aa2b-f874432f07df","resolution":{"observed_at":"2026-07-04T00:49:19.230531Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":"2503.19786","doi":"10.1007/978-3-540-48085-3_36","metadata_source":"pith","pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemma 3 Technical Report","venue":"cs.CL","work_id":"f93e08bf-9e96-409b-8ac6-b8385fd17fd7","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:cbce59ec4ca53493f4df3570b225067ed9a96c2a2b9fda6f563cb6433cb3226f","observation_id":"6969ea20-7901-4607-abca-b9018cfccf80","resolution":{"observed_at":"2026-07-04T00:49:19.190898Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":"2502.14786","doi":"10.48550/arxiv.2502.14786","metadata_source":"pith","pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","venue":"cs.CV","work_id":"50eec732-2d41-432f-9dcf-ac7fff235ea5","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:1976bee32470ecd580a4843823bb688859180e8c4ea6fb6f8dd1bbe113578f93","observation_id":"abfccb1c-3e97-4a79-b498-cd004b12dba1","resolution":{"observed_at":"2026-07-04T00:49:19.172207Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T23:49:08.777694+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07617","last_updated":"2026-05-31T18:45:03Z","snapshot_observed_at":"2026-07-06T20:34:48.850154Z","submitted_at":"2025-02-11T15:05:33Z","title":"Scaling Pre-training to One Hundred Billion Data for Vision Language Models","version":2},"cited_work":{"arxiv_id":"2502.07617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.07617","snapshot_observed_at":"2026-07-04T00:49:19.193120Z","title":"Scaling pre-training to one hundred billion data for vision language models.arXiv preprint arXiv:2502.07617, 2025a","venue":"cs.CV","work_id":"368c410b-8396-411d-b445-36d9f0f44537","year":2025},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2502.07617","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:9c0a2696a853ebf06d14bd39c496a4d1639a977431448e30644c3be788751969","observation_id":"bcf2fc55-31ca-4fa8-abe4-c2168bb3593c","resolution":{"observed_at":"2026-07-04T00:49:19.195832Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"cited_work":{"arxiv_id":"2309.16671","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.16671","snapshot_observed_at":"2026-07-04T20:50:12.667951Z","title":"Demystifying CLIP Data","venue":"cs.CV","work_id":"7af932a5-c6d2-4f55-9522-7777cc3fa5ae","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2309.16671","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:d24c5ef57e9486fe8354610d08d8b16b781939e9440fd79c05bc9abc5217ebd2","observation_id":"0b3c985a-f1f3-4b88-b7af-7c74314198ab","resolution":{"observed_at":"2026-07-04T00:49:19.181436Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03409","last_updated":"2024-04-15T07:50:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-07T00:07:15Z","title":"Large Language Models as Optimizers","version":3},"cited_work":{"arxiv_id":"2309.03409","doi":"10.48550/arxiv.2309.03409","metadata_source":"pith","pith_arxiv_id":"2309.03409","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Models as Optimizers","venue":"cs.LG","work_id":"cacd55e1-79db-4dd6-9f1b-794fc09d75bb","year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2309.03409","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:6263948a408ed466a64b32c556dd070806e5e0b833d64e2b68331cf658f4125e","observation_id":"cf4f49d8-1f70-489b-8683-ce1c00aa6e29","resolution":{"observed_at":"2026-07-04T00:49:19.235077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01917","last_updated":"2022-06-14T00:48:04Z","snapshot_observed_at":"2026-07-06T13:06:27.153765Z","submitted_at":"2022-05-04T07:01:14Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","version":2},"cited_work":{"arxiv_id":"2205.01917","doi":"10.48550/arxiv.2205.01917","metadata_source":"pith","pith_arxiv_id":"2205.01917","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CoCa: Contrastive Captioners are Image-Text Foundation Models","venue":"cs.CV","work_id":"5dd5bf10-d548-40ff-9b6c-6735129b27ee","year":2022},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2205.01917","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:023bd76d530878f6d16dbd76166db6914bb6102aa67257afc7da1fce9e8970b4","observation_id":"950179fd-155c-499d-88e5-8da671c702dd","resolution":{"observed_at":"2026-07-04T00:49:19.259387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T13:22:43.398968+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Scaling vision transformers","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:8b4656a36e6be86f09b75b863f262aaae623ca528d54deac6db5d74ed88b40d6","observation_id":"34451644-0e85-47e9-980a-7eefb87abe42","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19651","last_updated":"2024-06-24T23:41:29Z","snapshot_observed_at":"2026-08-04T07:44:45.555675Z","submitted_at":"2024-03-28T17:59:20Z","title":"MagicLens: Self-Supervised Image Retrieval with Open-Ended Instructions","version":2},"cited_work":{"arxiv_id":"2403.19651","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.19651","snapshot_observed_at":"2026-07-04T00:49:19.246582Z","title":"Magiclens: Self-supervised image retrieval with open-ended instructions","venue":null,"work_id":"c942d433-c67a-4aa0-9bd6-7a407f890918","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2403.19651","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:92b7cced596920fc3cad40bfc3a9e3f6f15a4b7549003014f36989128cc2b1a1","observation_id":"43eea2a8-91f0-4808-b12d-7c5e1088cdb6","resolution":{"observed_at":"2026-07-04T00:49:19.250279Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04292","last_updated":"2024-06-06T17:37:47Z","snapshot_observed_at":"2026-07-06T18:26:42.010940Z","submitted_at":"2024-06-06T17:37:47Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","version":1},"cited_work":{"arxiv_id":"2406.04292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.04292","snapshot_observed_at":"2026-07-04T00:49:19.252122Z","title":"VISTA: Visualized Text Embedding For Universal Multi-Modal Retrieval","venue":null,"work_id":"8a235669-f389-4dc2-9c86-62178ef65cd1","year":2024},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"cited_paper":"/paper/2406.04292","citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:821692372acddcebe8233a8d5ef83d22f1727b34b05ab00b2edf5117333a4b3b","observation_id":"c764cc1d-0431-4631-ac7a-56970e5dd1b3","resolution":{"observed_at":"2026-07-04T00:49:19.255293Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"However, its practical application and further development are subject to certain limitations, which also open avenues for future research","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:47b792d309ac67a4fc2c3059e8b6222969ad8377641a64107fda58712092785b","observation_id":"c24c57e1-e3a7-4ef1-b4f8-eda8f79322fb","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"(2021), SigLip Zhai et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:af9f3493633da925bf8c547c320ccf12ae0f5537f401fd32d316a827ef75978f","observation_id":"3026f273-31af-4762-aecd-544733f4dfb6","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"Interestingly, by leveraging Gemini to evolve and generate different text prompts Yang et al","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:d89236612e807536445188c20389123dee51cf21b565c5fb14299824777e5f05","observation_id":"b31ba3f7-e307-4343-9c7d-5eac1b8b6016","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:3b08bfe3d0e02fb26fe96e8e4f41866175c2c752675bb09538e7ea684ed0a075","observation_id":"4afd2aa5-0bde-41c6-a55b-97b803725cd8","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":"The resulting distribution, visualized in Figure 13, reveals significant variations in instruction fre- quency","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:6cf21fa5f5ec8c27523f5fd40b2af4fa9cececc4b586fa8f463d56d31e4fdb1e","observation_id":"f6d734c5-ba85-4df6-843c-595b9a9c37be","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-26T20:54:48.203293Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-26T20:54:48.203293Z"},"links":{"citing_paper":"/paper/2606.19584"},"observation_digest":"sha256:7589764a06acdbf7cdab928809235b2cb3f5f6a409f16fc5b41f0fd884bdeff3","observation_id":"1f6a59b5-a165-44a2-99d0-43b7855c8550","resolution":{"observed_at":"2026-06-26T20:54:48.203293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.19584","last_updated":"2026-06-17T20:39:04Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-02T11:09:20.686138Z","submitted_at":"2026-06-17T20:39:04Z","title":"Language-Instructed Vision Embeddings for Controllable and Generalizable Perception"},"reference_resolution":{"displayed":37,"state_counts":{"malformed_identifier":3,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":8,"verified_exact":23,"verified_fuzzy":0},"total_outbound_references":37},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 37 of 37 outbound references and 1 inbound Pith citation observation for arXiv:2606.19584."}