{"as_of":"2026-08-09T14:07:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:288b8c1747858826b11384b82149026ed414f0a69a9b8d4b4d7626035b8d2db3","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T01:06:08.321921Z","state":"measured"},{"denominator":32,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":32,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T13:57:07.449816Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T22:17:26.125055Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-08-06T13:57:07.449816Z","title":"How visual representations map to language feature space in multimodal llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19891","last_updated":"2025-07-30T04:47:07Z","snapshot_observed_at":"2026-08-09T03:50:13.576578Z","submitted_at":"2025-07-26T09:43:09Z","title":"Interpretable Open-Vocabulary Referring Object Detection with Reverse Contrast Attention","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T13:57:07.449816Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2507.19891"},"observation_digest":"sha256:6ba0b309d5cdd27f98f129453547aaa8ff86560bce05fc28cc28c29335053c55","observation_id":"7f81683f-e654-4363-ad77-03ebc2dffce9","resolution":{"observed_at":"2026-08-06T13:57:07.449816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":"2506.11976","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-07-02T22:17:26.125055Z","title":"How visual representations map to language feature space in multimodal llms.CoRR, abs/2506.11976, 2025","venue":null,"work_id":"f15d5da5-0c74-4daf-9c18-b069198f1aa9","year":2025},"citing_paper":{"arxiv_id":"2606.08511","last_updated":"2026-06-07T08:32:13Z","snapshot_observed_at":"2026-07-06T23:48:02.118629Z","submitted_at":"2026-06-07T08:32:13Z","title":"Look Less, Reason More: Block-wise Attention Skipping for Efficient Multimodal LLMs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T19:02:59.403688Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2606.08511"},"observation_digest":"sha256:9774b311d6a08fc24c92ea08219cf623b59f9b331d23e147af49eca5c11fc74f","observation_id":"ab9ce2f3-d682-4f24-bbce-0a77ab76cb60","resolution":{"observed_at":"2026-07-02T22:17:26.126763Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.11976","snapshot_observed_at":"2026-07-12T03:03:11.110105Z","title":"arXiv preprint arXiv:2506.11976 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.03358","last_updated":"2026-07-03T14:15:08Z","snapshot_observed_at":"2026-08-08T02:03:25.885310Z","submitted_at":"2026-07-03T14:15:08Z","title":"Pathways of Visual Information Flow in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-07-12T03:03:11.110105Z"},"links":{"cited_paper":"/paper/2506.11976","citing_paper":"/paper/2607.03358"},"observation_digest":"sha256:77370702e912b41d4c71e205a6b155fb558277b5e2c2069fab5f24770cdd0991","observation_id":"4f28d0ec-44f2-4d3f-927d-2075dbb823b4","resolution":{"observed_at":"2026-07-12T03:03:11.110105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.11976/citation-record","integrity":"/paper/2506.11976/integrity","json":"/paper/2506.11976/citation-record.json","paper":"/paper/2506.11976"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:12.108109Z","title":"Towards monosemanticity: Decomposing language models with dictionary learning, 2023","venue":null,"work_id":"00181d0d-6146-4e66-8ec1-ee4544599db0","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.197245Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:a34ae4213c89f37fda42e86b78acc8c3250a4ff421ea1d8a675f880944f63a20","observation_id":"d3699c23-1c90-4763-8c70-44707168202f","resolution":{"observed_at":"2026-08-07T01:06:12.186433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10591","last_updated":"2023-10-16T17:12:06Z","snapshot_observed_at":"2026-08-07T04:47:37.971137Z","submitted_at":"2023-10-16T17:12:06Z","title":"Interpreting and Controlling Vision Foundation Models via Text Explanations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10591","snapshot_observed_at":"2026-08-07T01:06:06.285352Z","title":"Interpreting and controlling vision foundation mod- els via text explanations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.285352Z"},"links":{"cited_paper":"/paper/2310.10591","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:a0f3692558cef41082571a4c86e4a5f23e72d213a57efc381349596b2d1aa6ae","observation_id":"07ce8781-2025-4982-8acf-de1552b550a7","resolution":{"observed_at":"2026-08-07T01:06:06.285352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.866477Z","title":"InstructBLIP: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":"ace65fd2-5470-4ae3-a7a5-2fc1165baad5","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.381515Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:33a1728fe2f21c7f83d18ea7734742debe2bccd6a9fc14534d06ca327eac4b80","observation_id":"66ce3c5d-6bcf-4256-b409-918c0da41987","resolution":{"observed_at":"2026-08-07T01:06:11.979935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.666169Z","title":"The cognitive revolution in interpretability: From explaining behavior to interpreting representations and algorithms, 2024","venue":null,"work_id":"c106cc3b-e0f4-4044-a4e9-ee773aa0819f","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.453896Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:9aae8361471300d79688f723662b3080879d81874db9bc660900fd1629785635","observation_id":"7e7d4643-cb6b-4356-abae-16728f76041d","resolution":{"observed_at":"2026-08-07T01:06:11.736793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.438693Z","title":"Arik, Tejas Nama, and Tomas Pfister","venue":null,"work_id":"50675781-c04b-4759-8006-f9684a551fb4","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.522248Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:c3e7a18866fa4c29620182cc920867cb4fe7e2e74247a7e26f8b69152029bbf0","observation_id":"7c89694a-e792-44b8-a725-35da8d656625","resolution":{"observed_at":"2026-08-07T01:06:11.548557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.211937Z","title":"A mathemati- cal framework for transformer circuits","venue":null,"work_id":"66aea9af-0286-4cd6-be87-71074981bce3","year":2021},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.622671Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:58a626b86e27c2cb6f676d227212780a3619322153a0519a58b97c88e8a7ccc6","observation_id":"5236b704-0e78-42c1-9656-03a507e1ed67","resolution":{"observed_at":"2026-08-07T01:06:11.309715Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:06.715063Z","title":"Mme: A compre- hensive evaluation benchmark for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.715063Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:d200d8b0b42c81bc8a3d85141aabcc8f0ccb292a59371cb9bd55e101c9298b3d","observation_id":"b317eb25-217e-4507-9681-f25af730f1b5","resolution":{"observed_at":"2026-08-07T01:06:06.715063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05916","last_updated":"2024-03-29T03:40:47Z","snapshot_observed_at":"2026-08-07T05:17:24.854291Z","submitted_at":"2023-10-09T17:59:04Z","title":"Interpreting CLIP's Image Representation via Text-Based Decomposition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05916","snapshot_observed_at":"2026-08-07T01:06:06.784761Z","title":"In- terpreting clip’s image representation via text-based decom- position","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.784761Z"},"links":{"cited_paper":"/paper/2310.05916","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:2a1df2f17608977c4c18735ee24cb223fb9114da2afe5904973e4d03e68f9185","observation_id":"7a117c9c-7741-4049-a70a-582d506c319e","resolution":{"observed_at":"2026-08-07T01:06:06.784761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:11.010498Z","title":"Sparse autoencoders find highly interpretable features in language models","venue":null,"work_id":"ca4f8d06-b726-434a-b2fc-7b8769a42094","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.856612Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:13eb44cc6dcec2f792353915461c8780171918caf7aff358047f2d3ad507d954","observation_id":"b1144db9-52c8-4570-8c84-dbfcb944205a","resolution":{"observed_at":"2026-08-07T01:06:11.122586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.844047Z","title":"Hudson and Christopher D","venue":null,"work_id":"4a3dae88-726a-40ed-8693-956524a8aa65","year":2019},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.898241Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:0efccce5dadc4941f0f19a2b94204b06cd41d51f0efbc24049d70997811d391b","observation_id":"404ab531-414f-4122-a3e4-11bce77cf204","resolution":{"observed_at":"2026-08-07T01:06:10.917163Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02762","last_updated":"2025-02-10T20:13:31Z","snapshot_observed_at":"2026-07-06T19:27:11.995338Z","submitted_at":"2024-10-03T17:59:57Z","title":"Interpreting and Editing Vision-Language Representations to Mitigate Hallucinations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02762","snapshot_observed_at":"2026-08-07T01:06:06.969709Z","title":"Interpreting and editing vision-language rep- resentations to mitigate hallucinations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:06.969709Z"},"links":{"cited_paper":"/paper/2410.02762","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:9a357a689922f28239b751107c59dc5fda102059090c311662bf72bc18a2a28c","observation_id":"25f00dca-de3e-4cfd-883d-653b0b12c346","resolution":{"observed_at":"2026-08-07T01:06:06.969709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.615838Z","title":"Evaluating object hallucination in large vision- language models","venue":null,"work_id":"9dc8e404-1828-49e2-8617-749857fe5c57","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.035217Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:85a5ebd1263fcc1795863b04075c41c3cc509fdc440c278ec9df2d4703712cc6","observation_id":"f8983eb4-1142-47d0-a99a-f09f64e827d3","resolution":{"observed_at":"2026-08-07T01:06:10.725401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.05147","last_updated":"2024-08-19T07:51:05Z","snapshot_observed_at":"2026-08-04T11:44:14.524984Z","submitted_at":"2024-08-09T16:06:42Z","title":"Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.05147","snapshot_observed_at":"2026-08-07T01:06:07.108965Z","title":"Gemma scope: Open sparse autoencoders everywhere all at once on gemma 2","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.108965Z"},"links":{"cited_paper":"/paper/2408.05147","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:11af3977c28aa9bfcd2abd2db46c8ec156738db579998074e1d735f9a68ce0de","observation_id":"bc6efdc3-a151-4fdc-8221-4521bf9c9819","resolution":{"observed_at":"2026-08-07T01:06:07.108965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.418166Z","title":"Vila: On pre-training for vi- sual language models","venue":null,"work_id":"d31aef53-0a1f-4c89-8936-2b078eed827c","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.179332Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:6eb0cf51f3881fbec3db1c3c062c4e1de6673f4b57a6e26953ae479b7a29b693","observation_id":"fd8c4433-db51-480c-9055-8664a4eeb97a","resolution":{"observed_at":"2026-08-07T01:06:10.496925Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:07.260602Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.260602Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:aa5720365189db69c862dbd334f086f9fce939cdcff1ba32bd08b1c8ae56e5c8","observation_id":"effa39d3-0c87-4fb8-82dc-ef0a4cb5c2e6","resolution":{"observed_at":"2026-08-07T01:06:07.260602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:10.172936Z","title":"Improved baselines with visual instruction tuning","venue":null,"work_id":"1de07137-c34e-437a-944c-14ccd62119c5","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.352145Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:c8cce54ff595e5b487ef293fffda74643f5376c353d653ab90ba6a72f436ac88","observation_id":"84d95b6d-8393-4dd3-8645-5dce02161448","resolution":{"observed_at":"2026-08-07T01:06:10.270709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.960187Z","title":"Linearly mapping from image to text space","venue":null,"work_id":"f8975236-368d-421e-b3e1-e1d4060b73ef","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.431580Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:b5d0a2342a1ea624651fb33aaca6c1a761209ef898d86f1fe0b412d39f44cd13","observation_id":"f6af390d-ded8-46ac-8748-6fbbe7850e37","resolution":{"observed_at":"2026-08-07T01:06:10.054001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-03T16:26:26.684826Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-08-07T01:06:07.506978Z","title":"Towards interpreting visual infor- mation processing in vision-language models.arXiv preprint arXiv:2410.07149, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.506978Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:c3d440aadaef628cf5dc0ef7383cfb55b7cc7d67284ba5c3a6b45da27f3d4ac3","observation_id":"92687b32-7c75-438b-814d-b08c34cffdf8","resolution":{"observed_at":"2026-08-07T01:06:07.506978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.787136Z","title":"Interpreting GPT: The Logit Lens","venue":null,"work_id":"f9e5b2b3-ee98-4db4-883b-3284fae5dd84","year":2020},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.567052Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:e2882ba61c69c59a533422c812876e2e616d9b0a56d1c6748c08424c3d738185","observation_id":"847a9d7a-2e48-49a5-be4d-14db007b01ea","resolution":{"observed_at":"2026-08-07T01:06:09.841272Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:07.644453Z","title":"Towards vision-language mechanistic interpretabil- ity: A causal tracing tool for blip","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.644453Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:dbf7e166e53c91072253e5d64582878d9f25ab43b08f13fd30f3cc7d7b0e238f","observation_id":"5022e038-1a89-4d2d-97d9-b8f83fd8bd5a","resolution":{"observed_at":"2026-08-07T01:06:07.644453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.593635Z","title":"Bridg- ing vision and language spaces with assignment prediction","venue":null,"work_id":"f5310099-4321-4766-9e9f-cafe0a800c7c","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.743327Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:01e14323cf4df572d2035fdbb57f463372f13c3efb16fe4682d2789330349865","observation_id":"d98f162a-bd02-4070-869c-7b659162ab52","resolution":{"observed_at":"2026-08-07T01:06:09.654978Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.437616Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":"abdf2df2-276d-44a1-b4ed-9b8fc95255a5","year":2021},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.811626Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:736dbb28579bd6eb7cba9927369bf63763427d4fb8002cf08176415d31d3c2ec","observation_id":"ca3e0edd-32ae-4375-bd68-ed81739091d9","resolution":{"observed_at":"2026-08-07T01:06:09.493256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.258911Z","title":"Multimodal neurons in pre- trained text-only transformers","venue":null,"work_id":"5f13fa4e-15db-4ea7-aad4-b9a886ccdac4","year":2023},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.913318Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:e4a94addb8e17ed99a6216ce7948a0d52e8731313475f87e307fc882d955daab","observation_id":"5f3e4212-a992-4b9f-8e5d-e364113e2139","resolution":{"observed_at":"2026-08-07T01:06:09.338873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16496","last_updated":"2025-01-27T20:57:18Z","snapshot_observed_at":"2026-07-06T20:27:04.664873Z","submitted_at":"2025-01-27T20:57:18Z","title":"Open Problems in Mechanistic Interpretability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16496","snapshot_observed_at":"2026-08-07T01:06:07.977614Z","title":"Open problems in mechanistic interpretability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:07.977614Z"},"links":{"cited_paper":"/paper/2501.16496","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:fc034170b22e701ed6250f6f2aa257ed225ed8cc2ad4cf813325528d7cb0630d","observation_id":"54ecaa4c-e899-43b5-925b-20aa394b7bd5","resolution":{"observed_at":"2026-08-07T01:06:07.977614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:09.087301Z","title":"Paligemma 2: A family of versatile vlms for transfer, 2024","venue":null,"work_id":"8933ecf2-613a-4c27-a449-c46973a380fd","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.055607Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:93e26cf8f44617a7c098a78585acace4ace81f0059327e6bab2f503b84c46f56","observation_id":"1937f5de-3784-4034-89c3-3e0a890480da","resolution":{"observed_at":"2026-08-07T01:06:09.161200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-07T01:06:08.123176Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.123176Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:adecac12a313889a1abb6cef410be950b48370245f4188f120c60429af37532f","observation_id":"2083da55-8b62-4185-94f9-0d851b8bdc27","resolution":{"observed_at":"2026-08-07T01:06:08.123176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.911935Z","title":null,"venue":null,"work_id":"c968e2f3-fcfe-4526-aba4-c287f472503c","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.199039Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:2c164fa29f0a94482ac81002d72e7b508eec4a2d8c764c137e5e52b0d482d665","observation_id":"b9431d42-e8cf-47df-9a14-6e6a98d5e4d6","resolution":{"observed_at":"2026-08-07T01:06:08.998912Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.756522Z","title":"Metamorph: Multimodal un- derstanding and generation via instruction tuning, 2024","venue":null,"work_id":"fe364717-872b-4d7d-b3ef-04f79e674d09","year":2024},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.244823Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:cd8a3283fdc6c04380936784d724eae0fc649d13be8e3974bddb38444b16a81b","observation_id":"35c4f53e-89b3-4c81-81b7-9e89d9844c1c","resolution":{"observed_at":"2026-08-07T01:06:08.844753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T01:06:08.611890Z","title":"Too late to recall: The two-hop prob- lem in multimodal knowledge retrieval","venue":null,"work_id":"44b74816-4f87-43d3-a2a7-c41153b4e0c6","year":2025},"citing_paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T01:06:08.321921Z"},"links":{"citing_paper":"/paper/2506.11976"},"observation_digest":"sha256:4b6ad3ad1c088eab4c3bda286aa853e9da058786abb349c376623dc4cbbf6245","observation_id":"85d98845-988b-458e-8ad4-bda971176a71","resolution":{"observed_at":"2026-08-07T01:06:08.657295Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.11976","last_updated":"2025-06-22T00:39:23Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T15:55:07.685688Z","submitted_at":"2025-06-13T17:34:05Z","title":"How Visual Representations Map to Language Feature Space in Multimodal LLMs"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 3 inbound Pith citation observations for arXiv:2506.11976."}