{"as_of":"2026-08-22T03:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:31fa3d1e1b1c14f3737fdfd8be0bdb22fb109c5f873801d798cec47e4aad1807","coverage":[{"denominator":56,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":56,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:55:27.313147Z","state":"measured"},{"denominator":56,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":56,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.28640/citation-record","integrity":"/paper/2607.28640/integrity","json":"/paper/2607.28640/citation-record.json","paper":"/paper/2607.28640"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:22.224783Z","title":"Vision-language models struggle to align entities across modalities","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:22.224783Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:fc291035a7ddd46adf02a3d577ca4ed4a6bf8b25af788e6d5f56548b4ee7f065","observation_id":"0bf742f8-da7f-42ec-84c5-bb0a48f8177d","resolution":{"observed_at":"2026-08-03T00:55:22.224783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:22.388224Z","title":"Introducing Claude Haiku 4.5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:22.388224Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:fa866fbfcd03591d431499f77a6bf989db891b71a7d7477478d63c759204f9c7","observation_id":"3a0966a1-e105-4bf6-838f-4d5fa7fe0b14","resolution":{"observed_at":"2026-08-03T00:55:22.388224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:22.568678Z","title":"Introducing Claude Opus 4.6","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:22.568678Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:955abc95d954b2bc4c11e5ad1f86bb6bbff9338ba78e7860f4b1d5be2edb4499","observation_id":"00fe7b66-8fb3-4a60-b459-90d41d47cdc4","resolution":{"observed_at":"2026-08-03T00:55:22.568678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:22.702350Z","title":"Introducing Claude Sonnet 4.6","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:22.702350Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:3b8e19256146af24e7ac236b252f2251397c89f5d557ed1bca588c12b6452fc0","observation_id":"dc994809-00b1-4113-a0d8-727255b33736","resolution":{"observed_at":"2026-08-03T00:55:22.702350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-17T13:26:10.378579Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-03T00:55:22.846358Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:22.846358Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:12578ade66010d4fd68ae5048a76960e6f90f9f97f01f6ec9de57c4b817d0d59","observation_id":"42d50484-fd84-4d72-bb1f-45c4d67beb0d","resolution":{"observed_at":"2026-08-03T00:55:22.846358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-21T16:02:41.546193Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-03T00:55:22.982366Z","title":"Qwen2.5-VL Technical Report.arXiv e-prints, art","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:22.982366Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:1ecfc64dadd76bd040d8f053bf753f6ab15144b09657726cad5dfa7d9d82aec0","observation_id":"1a322ee7-bd9c-43d0-8fb1-c815e3775b67","resolution":{"observed_at":"2026-08-03T00:55:22.982366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12219","last_updated":"2024-10-16T04:29:46Z","snapshot_observed_at":"2026-08-17T13:13:38.204740Z","submitted_at":"2024-10-16T04:29:46Z","title":"OmnixR: Evaluating Omni-modality Language Models on Reasoning across Modalities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12219","snapshot_observed_at":"2026-08-03T00:55:23.079089Z","title":"Omnixr: Evaluating omni-modality language models on reasoning across modalities.arXiv preprint arXiv:2410.12219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.079089Z"},"links":{"cited_paper":"/paper/2410.12219","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:049a0f6ecf01e4c2e62746f2ee46f918f3d48cee375aca91b94aff3f8808cd6b","observation_id":"6704d8d7-3840-44fe-a0a4-fcc9e4296d58","resolution":{"observed_at":"2026-08-03T00:55:23.079089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05271","snapshot_observed_at":"2026-08-03T00:55:23.218254Z","title":"Expanding performance boundaries of open-source multimodal models with model, data, and test-time scaling.arXiv preprint arXiv:2412.05271, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.218254Z"},"links":{"cited_paper":"/paper/2412.05271","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:197ccaf5e604a7c428326459938adba73e98dca3f278b7c1f14d7aca111195b6","observation_id":"b9728877-6b05-4fac-836d-8c8630b34d32","resolution":{"observed_at":"2026-08-03T00:55:23.218254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:23.365501Z","title":"Reproducible scaling laws for contrastive language-image learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.365501Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:a4cf15d2f30ee14656274f02a9814b71546e437a1a3522e3bbc7481a7da8ceea","observation_id":"3b5de65c-cc3c-4a3d-a736-808e8970bbc6","resolution":{"observed_at":"2026-08-03T00:55:23.365501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-03T00:55:23.535097Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.535097Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:26191d699969ecc9ff3745731fb99c09a4b437ad5da7664a5f63f8bd4acb3b2a","observation_id":"8ab08e30-816b-402c-9b67-834b125bf141","resolution":{"observed_at":"2026-08-03T00:55:23.535097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17639","last_updated":"2024-09-16T15:32:11Z","snapshot_observed_at":"2026-08-16T13:39:44.134783Z","submitted_at":"2024-06-25T15:24:02Z","title":"Mitigate the Gap: Investigating Approaches for Improving Cross-Modal Alignment in CLIP","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17639","snapshot_observed_at":"2026-08-03T00:55:23.673276Z","title":"Mitigate the gap: Investigating approaches for improving cross-modal alignment in clip.arXiv preprint arXiv:2406.17639, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.673276Z"},"links":{"cited_paper":"/paper/2406.17639","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:e10ec8712f160c1950f8dc0da4cbd8073e694eb3c621bac4cb57165c386301a5","observation_id":"20e46a5d-9c0b-4505-9b39-08dc69a291c2","resolution":{"observed_at":"2026-08-03T00:55:23.673276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18570","last_updated":"2024-06-06T20:29:21Z","snapshot_observed_at":"2026-08-16T13:48:26.883064Z","submitted_at":"2024-05-28T20:28:07Z","title":"It's Not a Modality Gap: Characterizing and Addressing the Contrastive Gap","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18570","snapshot_observed_at":"2026-08-03T00:55:23.784825Z","title":"It’s not a modality gap: Characterizing and addressing the contrastive gap.arXiv preprint arXiv:2405.18570, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.784825Z"},"links":{"cited_paper":"/paper/2405.18570","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:2d3c2610dbd77b1c4d38da0b2b2b50f24e81e08209032656d1c03ca205ed3bb9","observation_id":"ee249f0b-2bac-43a7-aee1-5d80eed4bd09","resolution":{"observed_at":"2026-08-03T00:55:23.784825Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-03T00:55:23.885090Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:23.885090Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:db424ec924475eaedf25be5b388432c9dee47dc8ca46ff11864ce6955d064f5d","observation_id":"dc9a9875-1f58-44a3-8bfb-79d9dd641b67","resolution":{"observed_at":"2026-08-03T00:55:23.885090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:24.035488Z","title":"Datacomp: In search of the next generation of multimodal datasets.Advances in Neural Information Processing Systems, 36:27092–27112, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.035488Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:a1595a03710ed943acad6c190e52c8413e7d4fe67285efac987f48342854c137","observation_id":"f539f254-2506-4a97-b330-42f890d0f58a","resolution":{"observed_at":"2026-08-03T00:55:24.035488Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:24.111180Z","title":"Gemini API Models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.111180Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:366ef7c188da4d3fea1b9451f96a363dacf5cb58b06d9e82a775ed55526b6415","observation_id":"566e1361-173d-43c9-8ab6-142c4e7aaa54","resolution":{"observed_at":"2026-08-03T00:55:24.111180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-03T00:55:24.238463Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.238463Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:0292a8f4b33cde3cc8d2402b888ec385ef8e11e87825e44c472cb934925bcc4e","observation_id":"4f45055a-0d49-435c-a375-3294185d348b","resolution":{"observed_at":"2026-08-03T00:55:24.238463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01006","last_updated":"2026-01-01T13:07:25Z","snapshot_observed_at":"2026-08-03T18:50:30.558321Z","submitted_at":"2025-07-01T17:55:04Z","title":"GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01006","snapshot_observed_at":"2026-08-03T00:55:24.375267Z","title":"Glm-4.5 v and glm-4.1 v-thinking: Towards versatile multimodal reasoning with scalable reinforcement learning.arXiv preprint arXiv:2507.01006, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.375267Z"},"links":{"cited_paper":"/paper/2507.01006","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:5d23da4f0340243a190058a376b72a0c4a9ad2d8e2801f50cd8cc4b0d18db8c1","observation_id":"da25ee71-5af0-4d47-affb-c6f345106c52","resolution":{"observed_at":"2026-08-03T00:55:24.375267Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:24.586305Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.586305Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:88ac67f1c1294bfeba7634bababbaae9f4f2e4d79559979d3402f2a418ac7c3e","observation_id":"adbf1c56-c270-4099-918e-c7efecfbb718","resolution":{"observed_at":"2026-08-03T00:55:24.586305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:24.718228Z","title":"Scaling up visual and vision-language representation learning with noisy text supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.718228Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:0d4d7e669aea516421c2953f6da48e2f163149933eff936d81755a6bcf1d4076","observation_id":"1de3104f-f5af-406c-816f-21b71a80e72d","resolution":{"observed_at":"2026-08-03T00:55:24.718228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-22T00:56:08.009523Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-03T00:55:24.874739Z","title":"Llava-onevision: Easy visual task transfer.arXiv preprint arXiv:2408.03326, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.874739Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:d27223a12b1fb1889f84a33e91d7c8109817596cd535b72c4cb16cd0f65ce897","observation_id":"9f529eec-e8cb-4847-a198-10bc23fba8ef","resolution":{"observed_at":"2026-08-03T00:55:24.874739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:24.983000Z","title":"Mind the gap: Understanding the modality gap in multi-modal contrastive representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:24.983000Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:a3ba651acb67b50b1367466d46634060c68485ec32ed3ccdbc7a28adbdfc10a2","observation_id":"8975576b-32f3-4353-9b1e-dc1c66504366","resolution":{"observed_at":"2026-08-03T00:55:24.983000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.149705Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.149705Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:c9257177feca9c4c62cb8049cf2405820e41b145154edf8ef6942fb145a9858d","observation_id":"2142a2af-4d36-44b3-9c7d-7975c404ab32","resolution":{"observed_at":"2026-08-03T00:55:25.149705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.276883Z","title":"Mmbench: Is your multi-modal model an all-around player? InEuropean conference on computer vision, pages 216–233","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.276883Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:9f1fddeb334034a571e05911f28cdd1667f7f872bbb09df2814f102e53fee03d","observation_id":"012b3093-ea5f-4bdc-85bd-f04864a493b1","resolution":{"observed_at":"2026-08-03T00:55:25.276883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.361355Z","title":"Scene text recognition using higher order language priors","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.361355Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:db22d5edc3b8753c02481a77be85ce978fc7adf9dfaa3c8e4558eacfe7ea604c","observation_id":"86dc6205-2485-4ff5-8862-d7a54f39269d","resolution":{"observed_at":"2026-08-03T00:55:25.361355Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.450674Z","title":"GPT-4o System Card","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.450674Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:3d0f6219575b90fe923ae28a0bc313ab26693136179d649291b8400853249b08","observation_id":"d7ea08f0-a96b-48ba-a685-82f1f60e7849","resolution":{"observed_at":"2026-08-03T00:55:25.450674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.639465Z","title":"Introducing GPT-4.1 in the API","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.639465Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:8843355f4f0f6b14e8c8ba8aa3a2df4b5e6f04befc404d880827dd42266ce06c","observation_id":"4fc60180-ba70-4308-8b01-b080645a3c73","resolution":{"observed_at":"2026-08-03T00:55:25.639465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.735867Z","title":"Introducing GPT-5","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.735867Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:0fc23d270f3c480f85ff92712371bfed26b34a24dab05866ef967db895461af4","observation_id":"4f89df5b-97bc-4ea7-a589-c765dbdefef6","resolution":{"observed_at":"2026-08-03T00:55:25.735867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.804458Z","title":"Introducing GPT-5.1 for developers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.804458Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:fcaa47be7ed55d69cfe599780db25b8d3f341702271a36e1b8f74eacb2c3707f","observation_id":"436fbab9-e63f-4f85-8eb8-147172e5f104","resolution":{"observed_at":"2026-08-03T00:55:25.804458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.899217Z","title":"Introducing GPT-5.2","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.899217Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:98b4e04525702efdfb9e6f5d3e18bff4c943ccedc52d62a337ed7d16151c7387","observation_id":"3ec1c4cd-3148-4c4e-a76a-c064e3633caa","resolution":{"observed_at":"2026-08-03T00:55:25.899217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.999038Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.999038Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:e63076f407ed66db8be38fb11708737d58e65ac5b821be6e41d3f3a2d038679f","observation_id":"0cfd5b92-4b19-4b07-9f29-0776e74f1302","resolution":{"observed_at":"2026-08-03T00:55:25.999038Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07983","last_updated":"2025-04-16T10:50:18Z","snapshot_observed_at":"2026-08-16T14:01:38.562057Z","submitted_at":"2024-04-11T17:58:06Z","title":"Two Effects, One Trigger: On the Modality Gap, Object Bias, and Information Imbalance in Contrastive Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07983","snapshot_observed_at":"2026-08-03T00:55:26.037233Z","title":"Two effects, one trigger: On the modality gap, object bias, and information imbalance in contrastive vision-language models.arXiv preprint arXiv:2404.07983, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.037233Z"},"links":{"cited_paper":"/paper/2404.07983","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:2713a4ae7c8a4583615d92cfaf98af388fb993a9580c961b0c87cafa885d42ac","observation_id":"00f0db15-6aa4-411f-a033-4e59e2061d5e","resolution":{"observed_at":"2026-08-03T00:55:26.037233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-08-19T12:32:00.517027Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-03T00:55:26.080641Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprint arXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.080641Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:9516ecc30e790b8e42770e1794f21a74fc78be3bf031384259887b741aa94078","observation_id":"274f2c6e-a451-4eb8-a31d-569a5b5476c5","resolution":{"observed_at":"2026-08-03T00:55:26.080641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:26.122685Z","title":"Understanding the modality gap in clip.ICLR, Stockholm, Sweden, pages 8–10, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.122685Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:421db59aca9894771b581fcde1c524cc8c36ffabd90846aa52ef09db2d260a39","observation_id":"4c2ba4d4-a67a-41a8-abd2-5f8ec0eebcfc","resolution":{"observed_at":"2026-08-03T00:55:26.122685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:26.166125Z","title":"Towards vqa models that can read","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.166125Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:b8289c5b0d5cb773e139efc23aa7391f20a4dada18e87610d8844460077c6ea9","observation_id":"e2486b27-fd6e-437c-aea4-920b8f8e2bec","resolution":{"observed_at":"2026-08-03T00:55:26.166125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.15389","last_updated":"2023-03-27T17:02:21Z","snapshot_observed_at":"2026-08-20T09:51:02.717471Z","submitted_at":"2023-03-27T17:02:21Z","title":"EVA-CLIP: Improved Training Techniques for CLIP at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.15389","snapshot_observed_at":"2026-08-03T00:55:26.204914Z","title":"Eva-clip: Improved training techniques for clip at scale.arXiv preprint arXiv:2303.15389, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.204914Z"},"links":{"cited_paper":"/paper/2303.15389","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:58740fdfe50d2f60d5a530c8b4321b11b506336c1db222305fc2f5562e4d4966","observation_id":"efc69535-bf0e-4bd0-8bd8-f5406d23872f","resolution":{"observed_at":"2026-08-03T00:55:26.204914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.18179","snapshot_observed_at":"2026-08-03T00:55:26.251613Z","title":"Seam: Semantically equivalent across modalities benchmark for vision-language models.arXiv preprint arXiv:2508.18179, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.251613Z"},"links":{"cited_paper":"/paper/2508.18179","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:3cd6731db324b92a9882f1698d064184e2ec34acc8bae64e1ab5f02b60077a9f","observation_id":"351a9023-0a61-4de3-8da0-72858a7b8fe0","resolution":{"observed_at":"2026-08-03T00:55:26.251613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-08-20T18:27:04.837880Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-03T00:55:26.298996Z","title":"Gemini: A family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.298996Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:f78c401e12ee5ea8a2e665336c59867828f35d1e76562dd559ac4fca46a31710","observation_id":"217acad4-03c2-4acb-bdf2-ffef09a28bf1","resolution":{"observed_at":"2026-08-03T00:55:26.298996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-03T00:55:26.353484Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.353484Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:6a4564f03ab5c9928b12503b535eb0ab29e6b1807fec959c445cb90410189802","observation_id":"795124b8-4d41-470b-a4a5-3e20985a1bf5","resolution":{"observed_at":"2026-08-03T00:55:26.353484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2512.08923","last_updated":"2026-04-22T09:19:17Z","snapshot_observed_at":"2026-08-21T04:06:39.161711Z","submitted_at":"2025-12-09T18:57:07Z","title":"Same Content, Different Answers: Cross-Modal Inconsistency in MLLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.08923","snapshot_observed_at":"2026-08-03T00:55:26.402402Z","title":"Same content, different answers: Cross-modal inconsistency in mllms.arXiv preprint arXiv:2512.08923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.402402Z"},"links":{"cited_paper":"/paper/2512.08923","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:4f5c3b326efa4a6bb7d92d967f373b3163d97dc9944bf0a0ff4aeb1b71616457","observation_id":"c707c0d3-f389-4d8f-8197-e927dbff2e72","resolution":{"observed_at":"2026-08-03T00:55:26.402402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-03T00:55:26.464199Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.464199Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:4bab066201fbda7aa1a121a1e75ae21f16777a750d48b79dd7240b21e0c76b92","observation_id":"1eabe3f4-4d68-4aa1-a539-42d62e00c877","resolution":{"observed_at":"2026-08-03T00:55:26.464199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-08-15T12:00:03.929140Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.15148","snapshot_observed_at":"2026-08-03T00:55:26.517339Z","title":"Xmodbench: Benchmarking cross-modal capabilities and consistency in omni-language models.arXiv preprint arXiv:2510.15148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.517339Z"},"links":{"cited_paper":"/paper/2510.15148","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:826205fb388c163b35255773a4f80deaae0d2001fdff88b0c26de750237fc301","observation_id":"ebbec044-eab8-4e3c-8dd3-ceeac2ed0673","resolution":{"observed_at":"2026-08-03T00:55:26.517339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-20T09:53:02.008012Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-03T00:55:26.568021Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing.arXiv preprint arXiv:2406.08464, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.568021Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:907a94820592a974b341e0bf33de86de2cd26eff0c2bd7953952b18353e14bff","observation_id":"8ca04334-b4c5-4f82-901d-24312791a546","resolution":{"observed_at":"2026-08-03T00:55:26.568021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:26.635411Z","title":"Explaining and mitigating the modality gap in contrastive multimodal learning.arXiv preprint arXiv:2412.07909, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.635411Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:a04c1a3c8d45723bd56d0a60985a14ade63a558d329dd7bcc5774b89538fc4cd","observation_id":"9b1609f3-bfac-4722-875a-be9f74c531c6","resolution":{"observed_at":"2026-08-03T00:55:26.635411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:26.669492Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.669492Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:75040db4a8c798f7497b4a84d2f9674533d72d1d4e25c4e64093c674648574ed","observation_id":"1e4f6912-b653-4bc9-8eac-cd853d9e8242","resolution":{"observed_at":"2026-08-03T00:55:26.669492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-08-20T22:20:11.069630Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-03T00:55:26.741382Z","title":"Mmmu-pro: a more robust multi-discipline multimodal understanding benchmark (2025).URL https://arxiv.org/abs/2409.02813, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.741382Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:333d3a31ac61fff19f24c848ae029871188cdffb0f460918f4ba29f31e5d56bb","observation_id":"62d4f79f-429e-4acf-9239-635abca262b9","resolution":{"observed_at":"2026-08-03T00:55:26.741382Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:26.794791Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.794791Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:8f6059274250c02eccad9a86f184354d34036d7312808c464ead38ddc449a71b","observation_id":"45c5474f-a472-4e98-a4de-1637082407b5","resolution":{"observed_at":"2026-08-03T00:55:26.794791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12520","last_updated":"2023-10-19T06:45:11Z","snapshot_observed_at":"2026-08-16T14:50:49.426722Z","submitted_at":"2023-10-19T06:45:11Z","title":"Lost in Translation: When GPT-4V(ision) Can't See Eye to Eye with Text. A Vision-Language-Consistency Analysis of VLLMs and Beyond","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12520","snapshot_observed_at":"2026-08-03T00:55:26.849480Z","title":"Lost in translation: When gpt-4v (ision) can’t see eye to eye with text","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.849480Z"},"links":{"cited_paper":"/paper/2310.12520","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:0e625ef998b7eb39f26f817123d4a0ba995973ccb8becbfde182199ac9aaf07f","observation_id":"74446a3f-8d0e-4e36-ba2a-d031d5df0af7","resolution":{"observed_at":"2026-08-03T00:55:26.849480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-19T09:06:13.683877Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-08-03T00:55:26.897977Z","title":"Cross-modal consistency in multimodal large language models.arXiv preprint arXiv:2411.09273, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.897977Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:b3607caca1dc67564f5a0450a700036653495bcd7251a73d58f5da0bc62c6d1d","observation_id":"0a8925eb-0edb-4761-9cb5-c604d27d11c5","resolution":{"observed_at":"2026-08-03T00:55:26.897977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-17T09:56:52.502317Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-03T00:55:26.936954Z","title":"apple,\"","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.936954Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:dbf661781bc6ba9e65b24294a106470690bd399755ea58be2b46568a6bf80d49","observation_id":"a8150157-dfc4-48d9-b641-ca7572dff2f1","resolution":{"observed_at":"2026-08-03T00:55:26.936954Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:26.982981Z","title":"- **RETURN FALSE IF**: The word is a verb but the image shows a noun (e.g., ’die’ as in death vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.982981Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:a20dd33c7fac5f483e1ffab51deb195c8b8b0a74dc0b228a2acbb9f9dbe7959e","observation_id":"ce086900-7c1e-4b2e-b0ed-6ecb8c0fa0cc","resolution":{"observed_at":"2026-08-03T00:55:26.982981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:27.028042Z","title":"human head","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:27.028042Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:9c15521f4c993138e68bbca6a27f7aa462e84783246118d7a76126dc576482bb","observation_id":"36b1e162-d94f-4555-9544-6780d6379617","resolution":{"observed_at":"2026-08-03T00:55:27.028042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:27.061895Z","title":"hot desert","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:27.061895Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:3c2d0c964b4201794d9fa8790d1f39d27e9c6a62ce750d184a2aaacacb975df1","observation_id":"defab8ea-7503-4279-af6a-33b0d096f24f","resolution":{"observed_at":"2026-08-03T00:55:27.061895Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:27.106744Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:27.106744Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:134f1bef3aebd326486d17d9ea1b9e73bc0bcdf76120a7643fdc2e7d8412f64e","observation_id":"f74b7389-febf-4d15-9008-3199f1dcac5a","resolution":{"observed_at":"2026-08-03T00:55:27.106744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:27.183439Z","title":"The hot <image> (sand) scorched his feet","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:27.183439Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:aaffbc7834d68a97a757f34930df5e0be9f5747d066a5a6878eed6546b84d769","observation_id":"1462c91f-f99c-4c5d-aaf1-14bea1506142","resolution":{"observed_at":"2026-08-03T00:55:27.183439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:27.313147Z","title":"XModBench [41] further extends cross-modal consistency evaluation to tri-modal settings involving text, vision, and audio","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:27.313147Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:1ecf15f0fbede0731d5eb7906165a40027a3fce0941ff4c7738584265eab1352","observation_id":"2c58c819-1f7a-4a70-bb93-684284bb516c","resolution":{"observed_at":"2026-08-03T00:55:27.313147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:55:25.958444Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:25.958444Z"},"links":{"citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:35f05071af2c78ee25fac7bef37a88309efcf32be4d5c62b991d656ccc39cbe1","observation_id":"a6958987-e9fb-4823-ad12-a23b65922f55","resolution":{"observed_at":"2026-08-03T00:55:25.958444Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs"},"reference_resolution":{"displayed":56,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":56},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 56 of 56 outbound references and 0 inbound Pith citation observations for arXiv:2607.28640."}