{"as_of":"2026-08-18T17:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:54a30bcabb2d9e3cd1edd117a1b684cc06047103c1395afea64e220523854889","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T15:10:13.086299Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T16:49:58.025162Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-12T20:27:19.970450Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09691","last_updated":"2024-11-14T18:57:07Z","snapshot_observed_at":"2026-08-18T13:55:45.506821Z","submitted_at":"2024-11-14T18:57:07Z","title":"Advancing Fine-Grained Visual Understanding with Multi-Scale Alignment in Multi-Modal Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T20:27:19.970450Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2411.09691"},"observation_digest":"sha256:20e3625328e8c4c9e0f23fe5af9ae79ddb38b51ebc7b77f64a8c13cef934241b","observation_id":"c5cea414-c347-43ed-8d89-640ad01738a2","resolution":{"observed_at":"2026-08-12T20:27:19.970450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-12T10:20:44.821297Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19378","last_updated":"2025-02-16T17:29:23Z","snapshot_observed_at":"2026-08-15T16:37:43.408072Z","submitted_at":"2024-11-28T21:07:22Z","title":"Libra: Leveraging Temporal Images for Biomedical Radiology Analysis","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T10:20:44.821297Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2411.19378"},"observation_digest":"sha256:77a86b557b4a9882ba6b8bf976d61b67004731f4f619c0ab5d14302faf1ccce4","observation_id":"87f820bf-13af-4c63-9f8a-c55ea640ef73","resolution":{"observed_at":"2026-08-12T10:20:44.821297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-11T22:14:09.681095Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.03735","last_updated":"2025-03-31T21:07:49Z","snapshot_observed_at":"2026-08-18T11:21:34.067844Z","submitted_at":"2024-12-04T22:03:19Z","title":"VidHalluc: Evaluating Temporal Hallucinations in Multimodal Large Language Models for Video Understanding","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-11T22:14:09.681095Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2412.03735"},"observation_digest":"sha256:b0352f583499c4ef4bb6d4e94a4c2ba5409278c33f959fd0e0837b62fa4a1ca1","observation_id":"d7a15a1a-c8b9-4686-adfe-973c94009a05","resolution":{"observed_at":"2026-08-11T22:14:09.681095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-11T14:21:46.527734Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.12077","last_updated":"2024-12-16T18:46:58Z","snapshot_observed_at":"2026-08-16T22:34:47.924434Z","submitted_at":"2024-12-16T18:46:58Z","title":"CPath-Omni: A Unified Multimodal Foundation Model for Patch and Whole Slide Image Analysis in Computational Pathology","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-11T14:21:46.527734Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2412.12077"},"observation_digest":"sha256:fd474610296f2dd29875aaadb477a2580d4610b6e7721671a1f49427cfc82f8c","observation_id":"b45d62d5-a49d-40b9-925b-a6e2f82afa10","resolution":{"observed_at":"2026-08-11T14:21:46.527734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-11T13:47:10.243345Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.12821","last_updated":"2024-12-17T11:41:49Z","snapshot_observed_at":"2026-08-16T09:14:02.188861Z","submitted_at":"2024-12-17T11:41:49Z","title":"ComprehendEdit: A Comprehensive Dataset and Evaluation Framework for Multimodal Knowledge Editing","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T13:47:10.243345Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2412.12821"},"observation_digest":"sha256:96379c2227cd3aa0944e1aa885a4f7caf24ca42bc4af3c4c3d9fcf4ccdf52842","observation_id":"f191937e-84f9-4da9-bf32-adca4d8e3361","resolution":{"observed_at":"2026-08-11T13:47:10.243345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-10T22:25:14.324383Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01720","last_updated":"2025-01-24T03:46:28Z","snapshot_observed_at":"2026-08-18T13:55:51.867927Z","submitted_at":"2025-01-03T09:25:04Z","title":"Interpretable Face Anti-Spoofing: Enhancing Generalization with Multimodal Large Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:14.324383Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2501.01720"},"observation_digest":"sha256:e1c555c2ec0bc281b7433a38303630f49e35746c0f72c983a5092a3dd61b9e8c","observation_id":"4bd58b9c-39b1-48e2-ad57-c9350f2b7e0d","resolution":{"observed_at":"2026-08-10T22:25:14.324383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-09T11:20:02.875384Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06814","last_updated":"2025-05-25T15:41:21Z","snapshot_observed_at":"2026-08-15T03:31:15.521541Z","submitted_at":"2025-02-04T22:20:20Z","title":"Diffusion Instruction Tuning","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-09T11:20:02.875384Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2502.06814"},"observation_digest":"sha256:1762fe1cc953d3d334db5850ba2fa511577d41df181d5b976594be747cfce19f","observation_id":"c7b5b60e-23e2-47cf-953a-30ef807b3ed0","resolution":{"observed_at":"2026-08-09T11:20:02.875384Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2503.21210","last_updated":"2026-04-07T08:34:05Z","snapshot_observed_at":"2026-08-14T15:00:00.284675Z","submitted_at":"2025-03-27T06:54:06Z","title":"Toward Generalizable Forgery Detection and Reasoning","version":4},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-22T22:26:49.062978Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2503.21210"},"observation_digest":"sha256:14527f72c42ec6149d9ba0bb29d7d7fc1f80582e7f7a5effcd355c5b0aba9414","observation_id":"1b2c9241-8d5b-4c41-983b-dcd4728b5c64","resolution":{"observed_at":"2026-05-22T22:27:12.473517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2504.07415","last_updated":"2026-04-18T04:19:29Z","snapshot_observed_at":"2026-07-06T21:07:04.785627Z","submitted_at":"2025-04-10T03:14:01Z","title":"RA-RRG: Multimodal Retrieval-Augmented Radiology Report Generation with Key Phrase Extraction","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-22T21:09:07.088042Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2504.07415"},"observation_digest":"sha256:89c27b3fedd364ae901ec83b2714adce2c2351762fce647bbf7bf7f57f04d38a","observation_id":"4372cebe-1cb5-48a4-8acd-b28cb473a856","resolution":{"observed_at":"2026-05-22T21:12:08.638336Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-07T11:26:13.676257Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.02557","last_updated":"2025-06-03T07:44:43Z","snapshot_observed_at":"2026-08-12T03:14:23.179364Z","submitted_at":"2025-06-03T07:44:43Z","title":"Kernel-based Unsupervised Embedding Alignment for Enhanced Visual Representation in Vision-language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T11:26:13.676257Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2506.02557"},"observation_digest":"sha256:6ada38938ae28a381b6e1f9cbb0cd1be81380fce597bc2324c233c0d6f4e7f65","observation_id":"dbba5313-2aad-4768-8d8a-e44aa9ffa657","resolution":{"observed_at":"2026-08-07T11:26:13.676257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T18:52:31.897432Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.07106","last_updated":"2025-07-09T17:59:47Z","snapshot_observed_at":"2026-08-10T20:06:39.029785Z","submitted_at":"2025-07-09T17:59:47Z","title":"Towards Multimodal Understanding via Stable Diffusion as a Task-Aware Feature Extractor","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T18:52:31.897432Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2507.07106"},"observation_digest":"sha256:aee05d9b20f3ce0b99904f2c5046abf72dd9a5ee350ee91a8f14f67e0bd6973e","observation_id":"ea4cd2ef-2034-4a1b-8b7a-f9b908f0b8ea","resolution":{"observed_at":"2026-08-06T18:52:31.897432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T13:18:01.907280Z","title":"From CLIP to DINO: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.20842","last_updated":"2025-07-28T13:50:53Z","snapshot_observed_at":"2026-08-13T17:48:59.129542Z","submitted_at":"2025-07-28T13:50:53Z","title":"METEOR: Multi-Encoder Collaborative Token Pruning for Efficient Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T13:18:01.907280Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2507.20842"},"observation_digest":"sha256:48fe643b4180e1ddfc9985ac8b7b98513b4952cc203be6bc838e40a0a3277859","observation_id":"31d9f30d-3254-4f1c-8878-c08df639758a","resolution":{"observed_at":"2026-08-06T13:18:01.907280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-06T05:00:04.849995Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.02401","last_updated":"2025-08-04T13:26:16Z","snapshot_observed_at":"2026-08-13T07:44:07.312192Z","submitted_at":"2025-08-04T13:26:16Z","title":"CompressKV: Semantic Retrieval Heads Know What Tokens are Not Important Before Generation","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T05:00:04.849995Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2508.02401"},"observation_digest":"sha256:24c26c55e99e3751bdba44339323b0fcaead7c6cbefe5d2d5378ea5852beb76e","observation_id":"6d5705cf-9e95-4c13-baa3-b7bdb6ecc9bd","resolution":{"observed_at":"2026-08-06T05:00:04.849995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-05T15:25:35.340576Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.19922","last_updated":"2025-08-27T14:30:08Z","snapshot_observed_at":"2026-08-16T17:36:03.255837Z","submitted_at":"2025-08-27T14:30:08Z","title":"HEAL: A Hypothesis-Based Preference-Aware Analysis Framework","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T15:25:35.340576Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2508.19922"},"observation_digest":"sha256:fc89ef6e56c902dd219f305d5f8869f17f5b74cc705357335d80235444e695f6","observation_id":"7de859b7-0815-4f8a-b1e1-53695a0ea7af","resolution":{"observed_at":"2026-08-05T15:25:35.340576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-05T14:33:18.602691Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21228","last_updated":"2025-08-28T21:39:53Z","snapshot_observed_at":"2026-08-17T12:01:29.970117Z","submitted_at":"2025-08-28T21:39:53Z","title":"Decoding Memories: An Efficient Pipeline for Self-Consistency Hallucination Detection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T14:33:18.602691Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2508.21228"},"observation_digest":"sha256:50cda79fefe99016d3cc07c928fdeb9adc5ed0482513035f50b660ce41bca508","observation_id":"6c61d66c-4586-4d15-846f-be83e0498925","resolution":{"observed_at":"2026-08-05T14:33:18.602691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-05T14:01:40.129707Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.21795","last_updated":"2025-08-29T17:22:13Z","snapshot_observed_at":"2026-08-09T15:16:10.024553Z","submitted_at":"2025-08-29T17:22:13Z","title":"TMUAD: Enhancing Logical Capabilities in Unified Anomaly Detection Models with a Text Memory Bank","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-05T14:01:40.129707Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2508.21795"},"observation_digest":"sha256:da2a234b58a6f068d8aebda51c09b87890e16d9cd608124e7405457fd9f52fc4","observation_id":"a92a6dea-f979-4319-b35a-d63074e2910a","resolution":{"observed_at":"2026-08-05T14:01:40.129707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-04T17:26:38.328095Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.10963","last_updated":"2025-09-13T19:44:42Z","snapshot_observed_at":"2026-08-11T09:59:53.099472Z","submitted_at":"2025-09-13T19:44:42Z","title":"Testing for LLM response differences: the case of a composite null consisting of semantically irrelevant query perturbations","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T17:26:38.328095Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2509.10963"},"observation_digest":"sha256:579416778215c350a92466e6e1709d2cb7c7d7f30fa5b4a1975dcdfab0a32aaf","observation_id":"a54931fd-ea48-473d-a5de-b2c9e84bb2d0","resolution":{"observed_at":"2026-08-04T17:26:38.328095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2511.11051","last_updated":"2026-05-22T01:46:51Z","snapshot_observed_at":"2026-08-14T06:24:52.262441Z","submitted_at":"2025-11-14T08:06:01Z","title":"NP-LoRA: Null Space Projection for Subject-Style LoRA Fusion","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-25T07:58:25.211030Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2511.11051"},"observation_digest":"sha256:2278ea240fff4c584778e8fccceef3b30d37fc195e078c23e83c4fdfef25bb39","observation_id":"41b63a2f-a473-4cd1-a457-f6f7c807a93b","resolution":{"observed_at":"2026-05-25T08:00:29.744034Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-03T20:23:03.179935Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models.arXiv preprint arXiv:2310.08825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2511.20272","last_updated":"2026-07-03T06:27:17Z","snapshot_observed_at":"2026-08-17T16:41:41.611109Z","submitted_at":"2025-11-25T12:58:32Z","title":"VKnowU: Evaluating Visual Knowledge Understanding in Multimodal LLMs","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T20:23:03.179935Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2511.20272"},"observation_digest":"sha256:37cb85009a865815ed5b9b15badea8a26b28577e5439114f2e033e73abf91d6c","observation_id":"da0fb4f2-cd52-41d2-a5f9-f584920f3438","resolution":{"observed_at":"2026-08-03T20:23:03.179935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2512.17321","last_updated":"2026-02-21T08:57:56Z","snapshot_observed_at":"2026-08-15T19:02:42.789926Z","submitted_at":"2025-12-19T08:08:40Z","title":"Neuro-Symbolic Control with Large Language Models for Language-Guided Spatial Tasks","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T21:19:37.970460Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2512.17321"},"observation_digest":"sha256:e43e933f5b9f4bdd61b389ca8f0801dbcea8f0b29778c1f6a657354222840752","observation_id":"c2906415-2ba2-4c97-b381-bcdb3c75e281","resolution":{"observed_at":"2026-05-16T21:21:17.260679Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-03T09:37:07.017396Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.13433","last_updated":"2026-05-29T00:45:48Z","snapshot_observed_at":"2026-08-15T16:06:55.758874Z","submitted_at":"2026-01-19T22:37:30Z","title":"Who Endorsed It? Measuring Authority Bias Across Expertise Levels in Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T09:37:07.017396Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2601.13433"},"observation_digest":"sha256:0432bdea8a63f9528b7b76d75c1c11582d1b2ab0225f7dfb978cedd2e8792113","observation_id":"008c6eab-522e-4181-8713-264b2bb71c45","resolution":{"observed_at":"2026-08-03T09:37:07.017396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-03T04:37:27.791489Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.04595","last_updated":"2026-07-22T11:57:18Z","snapshot_observed_at":"2026-08-13T15:58:08.779619Z","submitted_at":"2026-02-04T14:22:08Z","title":"Harmonia: Algorithm-Hardware Co-Design for Memory- and Compute-Efficient BFP-based LLM Inference","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T04:37:27.791489Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2602.04595"},"observation_digest":"sha256:c1177f66022a7b974bf26dfa5fa5045b10a837c08c33a329df4db48c1a73f521","observation_id":"f10a2e3c-0f71-4694-8865-08eabaf7a67d","resolution":{"observed_at":"2026-08-03T04:37:27.791489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-03T01:17:11.852907Z","title":"From clip to dino: Visual encoders shout in multi- modal large language models.arXiv preprint arXiv:2310.08825, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.10388","last_updated":"2026-05-29T05:05:29Z","snapshot_observed_at":"2026-08-07T17:40:15.715656Z","submitted_at":"2026-02-11T00:23:13Z","title":"Less is Enough: Synthesizing Diverse Data in LLM Feature Space with Sparse Autoencoders","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T01:17:11.852907Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2602.10388"},"observation_digest":"sha256:6a188e0162e47bee1e1a3e02f581dd9b043af0e5835f566546a86e684a261fb9","observation_id":"7b8810df-b7bb-4a6a-85ec-1bd91ca6ba43","resolution":{"observed_at":"2026-08-03T01:17:11.852907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2602.23024","last_updated":"2026-07-21T12:50:28Z","snapshot_observed_at":"2026-08-15T08:29:29.999538Z","submitted_at":"2026-02-26T14:03:58Z","title":"InCoM: Intent-Driven Perception and Structured Coordination for Mobile Manipulation","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-15T19:07:46.733450Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2602.23024"},"observation_digest":"sha256:06235aef0a844fe088aad6225098b255ff6056dcdba3fb45f4d58480363c823c","observation_id":"bba09ca1-9f4f-42cc-8fde-16e58a55610e","resolution":{"observed_at":"2026-05-15T19:10:15.922063Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-02T20:35:05.020062Z","title":"Jiang, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.23024","last_updated":"2026-07-21T12:50:28Z","snapshot_observed_at":"2026-08-15T08:29:29.999538Z","submitted_at":"2026-02-26T14:03:58Z","title":"InCoM: Intent-Driven Perception and Structured Coordination for Mobile Manipulation","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T20:35:05.020062Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2602.23024"},"observation_digest":"sha256:ac5537d198fc93c1e6cc586631d2ed755034dedce05bef0bbf31922fe0c8b353","observation_id":"14df1184-58e6-4ca9-a7e3-8590e06f4864","resolution":{"observed_at":"2026-08-02T20:35:05.020062Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2603.27437","last_updated":"2026-05-02T17:42:29Z","snapshot_observed_at":"2026-08-13T10:32:18.542608Z","submitted_at":"2026-03-28T22:49:40Z","title":"SpatialStack: Layered Geometry-Language Fusion for 3D VLM Spatial Reasoning","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-14T22:04:18.591594Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2603.27437"},"observation_digest":"sha256:52eedcaa598b77311f12b42ad837a5534cde1580a7999b8e5c582e7776d9bfef","observation_id":"cfd77212-2fac-4242-bb44-7c4465f2cec7","resolution":{"observed_at":"2026-05-14T22:08:04.602770Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2604.03231","last_updated":"2026-04-03T17:59:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-03T17:59:51Z","title":"CoME-VL: Scaling Complementary Multi-Encoder Vision-Language Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T20:28:30.864143Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2604.03231"},"observation_digest":"sha256:fdb587dbf13e1b9011c1cc93d892f080263754105be7dc162c7d113748e92b7d","observation_id":"6ab8a71c-97e8-40cf-87fd-de9bf6a49861","resolution":{"observed_at":"2026-05-13T20:33:17.149321Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2604.07812","last_updated":"2026-04-09T05:09:22Z","snapshot_observed_at":"2026-08-02T06:27:25.025040Z","submitted_at":"2026-04-09T05:09:22Z","title":"HAWK: Head Importance-Aware Visual Token Pruning in Multimodal Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:20:19.653806Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2604.07812"},"observation_digest":"sha256:d167fafe7441f5307d58e871ab3eae9d7a0d53ab26d36b6ddfc3e9edf7bfb2bc","observation_id":"639975b0-9fe4-424d-9db0-ddbfa385ee24","resolution":{"observed_at":"2026-05-11T07:01:05.567231Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2604.14710","last_updated":"2026-04-16T07:21:21Z","snapshot_observed_at":"2026-08-17T03:02:21.848135Z","submitted_at":"2026-04-16T07:21:21Z","title":"G-MIXER: Geodesic Mixup-based Implicit Semantic Expansion and Explicit Semantic Re-ranking for Zero-Shot Composed Image Retrieval","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T11:50:00.850857Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2604.14710"},"observation_digest":"sha256:25f506efe711d5e0ff4c2193c740621ae8dfbe56e10a80cacb44a6d954d30d47","observation_id":"a3803d08-b0de-4b1f-a851-f4046f935b27","resolution":{"observed_at":"2026-05-10T11:50:19.964062Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2604.17174","last_updated":"2026-04-19T00:08:35Z","snapshot_observed_at":"2026-08-18T02:51:17.490552Z","submitted_at":"2026-04-19T00:08:35Z","title":"Modeling Multi-Dimensional Cognitive States in Large Language Models under Cognitive Crowding","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T06:58:19.094492Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2604.17174"},"observation_digest":"sha256:b85cc1813161fbc8dfe7d25d4c72a8d960ac5099462cda9bb29255bf8f44ac44","observation_id":"c38471b3-d21d-4cb4-abf8-5df62635316d","resolution":{"observed_at":"2026-05-10T07:01:49.307858Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2604.22557","last_updated":"2026-04-24T13:52:25Z","snapshot_observed_at":"2026-08-12T21:39:11.948066Z","submitted_at":"2026-04-24T13:52:25Z","title":"Are Natural-Domain Foundation Models Effective for Accelerated Cardiac MRI Reconstruction?","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-08T09:08:28.326598Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2604.22557"},"observation_digest":"sha256:2d3600c46c333f3fc146a171124e094dd10edcba3cff21ab0da4447279d7fb01","observation_id":"3680a95e-b128-46bf-88c7-600e96d7739d","resolution":{"observed_at":"2026-05-11T20:26:11.344431Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.01687","last_updated":"2026-05-03T02:55:30Z","snapshot_observed_at":"2026-08-12T19:37:22.407983Z","submitted_at":"2026-05-03T02:55:30Z","title":"MultiBreak: A Scalable and Diverse Multi-turn Jailbreak Benchmark for Evaluating LLM Safety","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T16:00:32.413225Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.01687"},"observation_digest":"sha256:dfed8fd5d8054e9ab0ff89592d0c4c0183db609c753886ec1c99657fb86f90e0","observation_id":"58db8de2-4657-4f0c-b486-b091a2229339","resolution":{"observed_at":"2026-05-11T09:31:00.953629Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.10977","last_updated":"2026-05-23T02:41:17Z","snapshot_observed_at":"2026-08-12T03:20:45.063109Z","submitted_at":"2026-05-09T01:09:01Z","title":"PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-13T01:13:55.067785Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.10977"},"observation_digest":"sha256:66674e9d046c6a494721eb67ac32070a87ce55ec9db91854c676c9abb7e96e4c","observation_id":"bcc9241a-18f3-4ff0-848f-ec5f2df21fe7","resolution":{"observed_at":"2026-05-13T01:17:02.333089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.10977","last_updated":"2026-05-23T02:41:17Z","snapshot_observed_at":"2026-08-12T03:20:45.063109Z","submitted_at":"2026-05-09T01:09:01Z","title":"PASA: A Principled Embedding-Space Watermarking Approach for LLM-Generated Text under Semantic-Invariant Attacks","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-30T23:37:21.982973Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.10977"},"observation_digest":"sha256:74628d6fa11645a29aa5ff28fb8153621c0b8d89afbca8a41b053a88657d9f57","observation_id":"02cfb42a-25d1-4b9b-bb4f-5c3f5c1a48a5","resolution":{"observed_at":"2026-06-30T23:45:08.405020Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.17128","last_updated":"2026-05-16T19:22:54Z","snapshot_observed_at":"2026-08-16T21:30:53.360651Z","submitted_at":"2026-05-16T19:22:54Z","title":"New Wide-Net-Casting Jailbreak Attacks Risk Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-20T14:46:52.070071Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.17128"},"observation_digest":"sha256:13c9054e8c6dc1df094e38fa95de7d574ef75bdb491e31f2a9fd51b28f6a9888","observation_id":"507e19a5-b352-4bdb-a469-82e92d246550","resolution":{"observed_at":"2026-05-20T14:48:23.297324Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.19792","last_updated":"2026-05-19T12:56:32Z","snapshot_observed_at":"2026-08-16T22:44:57.493451Z","submitted_at":"2026-05-19T12:56:32Z","title":"Mechanisms of Object Localization in Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T06:46:20.141227Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.19792"},"observation_digest":"sha256:742019d7c96b6dc35c45b60c8278fc3c655474bf074c52e9afbca1c3ebf8e810","observation_id":"3c2bf51d-b6ca-4524-8d43-f8951ff71cf6","resolution":{"observed_at":"2026-05-20T06:48:05.803191Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.21300","last_updated":"2026-05-20T15:29:20Z","snapshot_observed_at":"2026-08-16T10:54:17.782632Z","submitted_at":"2026-05-20T15:29:20Z","title":"Reducing Object Hallucination in LVLMs via Emphasizing Image-negative Tokens","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-21T05:07:12.965100Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.21300"},"observation_digest":"sha256:9ca6cddf8aa26f9335e9bbdcbacb9592fb86b808f622422394d8dc1f8c333377","observation_id":"fdd383ec-bbde-4b1a-965e-ad04a6bb396d","resolution":{"observed_at":"2026-05-21T05:09:38.510067Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2605.24675","last_updated":"2026-05-23T17:25:45Z","snapshot_observed_at":"2026-08-14T12:09:01.789331Z","submitted_at":"2026-05-23T17:25:45Z","title":"VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:33:12.116833Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2605.24675"},"observation_digest":"sha256:e6e7299f0824981959bb1bdb2b5cf2dac39f610925c93443a93eb0ec953c1662","observation_id":"817649ba-9fa7-452b-af17-eb8b87251fd9","resolution":{"observed_at":"2026-06-30T13:34:40.271586Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2606.05609","last_updated":"2026-06-04T02:31:29Z","snapshot_observed_at":"2026-08-05T14:48:48.513078Z","submitted_at":"2026-06-04T02:31:29Z","title":"SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-28T01:16:07.252429Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2606.05609"},"observation_digest":"sha256:55446d280cc19f5df021b3ff0310dca60419424475d43f7607e6bb90a9b09812","observation_id":"55e98e71-8362-4592-b03c-286675d156b2","resolution":{"observed_at":"2026-07-02T13:26:59.346516Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2606.22237","last_updated":"2026-06-20T21:37:12Z","snapshot_observed_at":"2026-08-06T06:38:36.041719Z","submitted_at":"2026-06-20T21:37:12Z","title":"Investigating The Security of Modern AI and Cloud Infrastructure","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-26T11:31:39.910784Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2606.22237"},"observation_digest":"sha256:a3b5f9298cbac1a8ffa1c2a74844193682466993e62f92cfbb05c51c2920601e","observation_id":"2687d8ab-1295-47af-b1ca-0fb12f8f773d","resolution":{"observed_at":"2026-07-04T08:29:42.327590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2606.23693","last_updated":"2026-04-29T10:33:16Z","snapshot_observed_at":"2026-08-17T05:50:08.910296Z","submitted_at":"2026-04-29T10:33:16Z","title":"EXPO-SQL: Execution-based Clause-level Policy Optimization for Text-to-SQL","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-07-01T08:57:37.907354Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2606.23693"},"observation_digest":"sha256:80c29b757323d78586292d6806adb974b38a203bb8f7233825790b3670ae2af2","observation_id":"4ad0ef00-57c0-48b7-bbd6-c519d2da434e","resolution":{"observed_at":"2026-07-01T09:05:36.899599Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":"2310.08825","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-07-04T16:49:58.025162Z","title":"From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":"ce828e20-c692-4f35-9def-ae30d4d8c488","year":2024},"citing_paper":{"arxiv_id":"2606.24467","last_updated":"2026-06-23T11:59:46Z","snapshot_observed_at":"2026-08-13T17:28:18.693868Z","submitted_at":"2026-06-23T11:59:46Z","title":"CompressKV: Semantic-Retrieval-Guided KV-Cache Compression for Resource-Efficient Long-Context LLM Inference","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-26T00:11:57.763089Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2606.24467"},"observation_digest":"sha256:05015354086e3c10535935cfd945737ea67108cb442a9cff3927d74abedf4c08","observation_id":"a31b896d-ed4e-4428-8bb3-3714b9e5800b","resolution":{"observed_at":"2026-07-04T16:49:58.026479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08825","snapshot_observed_at":"2026-08-15T15:10:13.086299Z","title":"2024.From clip to dino: Visual encoders shout in multi-modal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01635","last_updated":"2026-08-03T03:07:54Z","snapshot_observed_at":"2026-08-18T02:02:56.674864Z","submitted_at":"2026-08-03T03:07:54Z","title":"Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T15:10:13.086299Z"},"links":{"cited_paper":"/paper/2310.08825","citing_paper":"/paper/2608.01635"},"observation_digest":"sha256:ad38d014f481a3a841bfc01dbdbf2654262ef2105c34fe96f3aafce12c4d6da4","observation_id":"309ad413-30c8-43a7-b124-7c7ef35c92d5","resolution":{"observed_at":"2026-08-15T15:10:13.086299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.08825/citation-record","integrity":"/paper/2310.08825/integrity","json":"/paper/2310.08825/citation-record.json","paper":"/paper/2310.08825"},"outbound":[],"paper":{"arxiv_id":"2310.08825","last_updated":"2024-03-08T02:49:12Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-18T13:55:05.541849Z","submitted_at":"2023-10-13T02:41:55Z","title":"From CLIP to DINO: Visual Encoders Shout in Multi-modal Large Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 43 inbound Pith citation observations for arXiv:2310.08825."}