{"as_of":"2026-08-04T07:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:079f7a1e71d4218b1e41c7392431d279deff4c2c89275a98796007e828e4bdc5","coverage":[{"denominator":16,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T21:56:29.924506Z","state":"measured"},{"denominator":19,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":19,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-26T11:43:17.464276Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-04T08:29:41.276218Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"cited_work":{"arxiv_id":"2604.02486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02486","snapshot_observed_at":"2026-07-04T08:29:41.276218Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","venue":"cs.CV","work_id":"e9476373-fb73-41da-902a-c1dc93721e49","year":2026},"citing_paper":{"arxiv_id":"2604.11302","last_updated":"2026-04-13T11:01:30Z","snapshot_observed_at":"2026-07-06T22:59:45.139155Z","submitted_at":"2026-04-13T11:01:30Z","title":"3D-Anchored Lookahead Planning for Persistent Robotic Scene Memory via World-Model-Based MCTS","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T15:05:39.801857Z"},"links":{"cited_paper":"/paper/2604.02486","citing_paper":"/paper/2604.11302"},"observation_digest":"sha256:a527f7debb94998fc9b160ee1100f0d039efbf72775683d73dcc56d0517f8f84","observation_id":"cecb2cf8-1aec-4423-a2b5-8ace25ee3c44","resolution":{"observed_at":"2026-05-11T11:11:06.924970Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"cited_work":{"arxiv_id":"2604.02486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02486","snapshot_observed_at":"2026-07-04T08:29:41.276218Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","venue":"cs.CV","work_id":"e9476373-fb73-41da-902a-c1dc93721e49","year":2026},"citing_paper":{"arxiv_id":"2604.14363","last_updated":"2026-04-15T19:26:30Z","snapshot_observed_at":"2026-07-06T23:02:09.426599Z","submitted_at":"2026-04-15T19:26:30Z","title":"The Cost of Language: Centroid Erasure Exposes and Exploits Modal Competition in Multimodal Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-10T13:25:27.762910Z"},"links":{"cited_paper":"/paper/2604.02486","citing_paper":"/paper/2604.14363"},"observation_digest":"sha256:7da5e85a72c725a2eeabb8281d7f07d16bfbe4de6681407486eff20eea93c4ef","observation_id":"7decb56d-ba39-4c72-82bc-4103d31c0b67","resolution":{"observed_at":"2026-05-10T13:35:26.781973Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"cited_work":{"arxiv_id":"2604.02486","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.02486","snapshot_observed_at":"2026-07-04T08:29:41.276218Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","venue":"cs.CV","work_id":"e9476373-fb73-41da-902a-c1dc93721e49","year":2026},"citing_paper":{"arxiv_id":"2606.22043","last_updated":"2026-06-20T13:48:19Z","snapshot_observed_at":"2026-07-06T23:56:59.635251Z","submitted_at":"2026-06-20T13:48:19Z","title":"When Does a Video-Language Model Stop Watching? Reward Strength Controls the Formation and Reversal of Visual Shortcuts in Multimodal RLVR","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-26T11:43:17.464276Z"},"links":{"cited_paper":"/paper/2604.02486","citing_paper":"/paper/2606.22043"},"observation_digest":"sha256:3fdff1e8cbea14c156dfe79ab384802903832408311933f5b5d51294ccb8a92e","observation_id":"c91128ae-5053-4e51-a1b2-d4b02d2bc15e","resolution":{"observed_at":"2026-07-04T08:29:41.277734Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2604.02486/citation-record","integrity":"/paper/2604.02486/integrity","json":"/paper/2604.02486/citation-record.json","paper":"/paper/2604.02486"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":"2308.12966","doi":"10.48550/arxiv.2308.12966","metadata_source":"pith","pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-07-10T11:37:03.214945Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","venue":"cs.CV","work_id":"cbc2bb21-b6bb-46c0-80bf-107e195ffe10","year":2023},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:ae0351db58d503c7a1b7a67468b8226da3d1f1e9a650fb360521cb5232db04fa","observation_id":"4295210a-ea64-4634-a8f4-458c4a8f8c81","resolution":{"observed_at":"2026-05-13T21:58:19.873755Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.06521","last_updated":"2026-07-07T15:04:59Z","snapshot_observed_at":"2026-08-03T11:25:34.815323Z","submitted_at":"2026-01-10T10:42:44Z","title":"BabyVision: Visual Reasoning Beyond Language","version":2},"cited_work":{"arxiv_id":"2601.06521","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.06521","snapshot_observed_at":"2026-07-10T09:37:00.824668Z","title":"Babyvision: Visual reasoning beyond language","venue":"cs.CV","work_id":"c3797ec2-73a2-46c7-bc93-8bf33dd8b187","year":2026},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2601.06521","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:0949db1860017d3589b9afbeccfd315d6aca377b67028b21a7cee5823ca7b32f","observation_id":"3be3dc69-02b2-43c8-ba62-ad5c117f3a99","resolution":{"observed_at":"2026-07-08T02:18:40.971166Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.11831","last_updated":"2026-01-15T23:30:35Z","snapshot_observed_at":"2026-07-06T21:25:27.942187Z","submitted_at":"2025-05-17T04:34:48Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","version":2},"cited_work":{"arxiv_id":"2505.11831","doi":"10.1145/3474666","metadata_source":"pith","pith_arxiv_id":"2505.11831","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"ARC-AGI-2: A New Challenge for Frontier AI Reasoning Systems","venue":"cs.AI","work_id":"2957f2ae-a92d-479e-a1ff-b0b522445d0b","year":2025},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2505.11831","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:28d31a0444d14e7847364ecfd50567bdbfc710c62fba0134143a04143fca20db","observation_id":"97016c81-9cef-4b73-ac5d-a0ee5e861fac","resolution":{"observed_at":"2026-05-15T16:49:50.752568Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08008","last_updated":"2025-06-09T17:59:54Z","snapshot_observed_at":"2026-07-06T21:39:13.304260Z","submitted_at":"2025-06-09T17:59:54Z","title":"Hidden in plain sight: VLMs overlook their visual representations","version":1},"cited_work":{"arxiv_id":"2506.08008","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08008","snapshot_observed_at":"2026-07-04T03:29:29.186840Z","title":"Hidden in plain sight: Vlms overlook their visual representations","venue":null,"work_id":"0ba9dd7e-1095-4032-8597-50ab7d170f29","year":2025},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2506.08008","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:da0013be6b99ba8e475bac36873899ba2b5a90108abf3b0a2135d34b73d9da58","observation_id":"4825b433-659f-4773-8bee-187497140f64","resolution":{"observed_at":"2026-05-13T21:58:19.843334Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.08402","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Accessed: 2026-03-13","venue":null,"work_id":"e2141874-8e28-40a1-92b9-87e09861ebf4","year":2026},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:cbb79cd44027601b9479e37055ee0a670a088b7a2925ee0a96369536156e4306","observation_id":"6426b7a2-73a1-413f-8eaf-4ec3f951840a","resolution":{"observed_at":"2026-05-13T21:58:19.835220Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.15960","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pisapia, Kenji Ikemura, Mert R","venue":null,"work_id":"c8eb2914-3bf5-470d-b772-3c88babd2ce0","year":null},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:1965f99d34e3ea3876e79fa992ba3ea1d25dbe1b892308f1beeae22f0072a8e9","observation_id":"f1203dc3-cdbf-4939-9a65-b98ca2e06a09","resolution":{"observed_at":"2026-05-13T21:58:19.840582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12832","last_updated":"2020-06-04T05:28:21Z","snapshot_observed_at":"2026-07-06T09:15:32.509412Z","submitted_at":"2020-04-27T14:21:03Z","title":"ColBERT: Efficient and Effective Passage Search via Contextualized Late Interaction over BERT","version":2},"cited_work":{"arxiv_id":"2004.12832","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.12832","snapshot_observed_at":"2026-07-04T11:59:51.231215Z","title":"Colbert: Efficient and effective passage search via contextualized late interaction over bert","venue":null,"work_id":"fddd8a9f-973c-4cc2-bd8a-6dcfb676f06d","year":2020},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2004.12832","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:5dd618406c8eea1780363f30a54670378afe2e4fb71d556496dcea609dc67b86","observation_id":"653bfb2b-8800-4429-9574-a79e0b574664","resolution":{"observed_at":"2026-05-13T21:58:19.868236Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.00462","last_updated":"2026-07-22T15:20:17Z","snapshot_observed_at":"2026-08-03T09:39:30.314678Z","submitted_at":"2026-01-31T02:33:07Z","title":"LatentLens: Revealing Highly Interpretable Visual Tokens in LLMs","version":5},"cited_work":{"arxiv_id":"2602.00462","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.00462","snapshot_observed_at":"2026-07-01T10:05:40.749429Z","title":"Latentlens: Revealing highly interpretable visual tokens in llms","venue":"cs.CV","work_id":"daab9a7b-01d8-4cf9-9cae-96eab75b283f","year":2026},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2602.00462","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:b542cb74156e527166e6ccb76a078e2ab84993971afe0ef3b7d0ce50accf4167","observation_id":"9ea23948-aff0-4e0e-84a5-0843887fd71d","resolution":{"observed_at":"2026-06-12T02:08:25.203802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.04819","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T17:15:52.008092Z","title":"Visual representations inside the language model.arXiv preprint arXiv:2510.04819","venue":null,"work_id":"a4e612c5-41bc-4e33-a80f-660d8922cece","year":2025},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:d6f6e42d3e49be6779c4b4475e84d42f0d8caf40530f82ef8bf6b4cf58e1aa89","observation_id":"49479763-0788-4b1d-8280-03678206a840","resolution":{"observed_at":"2026-05-13T21:58:19.859370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.15162","last_updated":"2023-03-09T15:02:07Z","snapshot_observed_at":"2026-08-03T16:26:24.368011Z","submitted_at":"2022-09-30T01:17:18Z","title":"Linearly Mapping from Image to Text Space","version":3},"cited_work":{"arxiv_id":"2209.15162","doi":"10.48550/arxiv.2209.15162","metadata_source":"pith","pith_arxiv_id":"2209.15162","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Linearly mapping from image to text space","venue":"cs.CL","work_id":"1470dc2c-e9da-4e3f-aa62-808e9aa7bc2e","year":2022},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2209.15162","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:ddbe9a8b5c0d524e665956c217c5e5ddb04b6fdc0131dd4768ac789e8931fabc","observation_id":"f41b1c30-9f69-4cde-8704-ce62ef659d5d","resolution":{"observed_at":"2026-05-13T21:58:19.846073Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10543","last_updated":"2019-08-28T04:16:52Z","snapshot_observed_at":"2026-07-06T08:17:20.450438Z","submitted_at":"2019-08-28T04:16:52Z","title":"SPair-71k: A Large-scale Benchmark for Semantic Correspondence","version":1},"cited_work":{"arxiv_id":"1908.10543","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.10543","snapshot_observed_at":"2026-07-04T13:49:51.655649Z","title":"Spair-71k: A large-scale benchmark for semantic correspon- dence","venue":null,"work_id":"5204ff4e-af27-47db-8f90-6af4daf72cf3","year":1908},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/1908.10543","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:85828020df4e500aadbd60ffb9c308126c23c2636b78e80ac20572518c29591c","observation_id":"7b4c1eec-7a33-4f31-9091-beeecad501a6","resolution":{"observed_at":"2026-05-13T21:58:19.856641Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07149","last_updated":"2025-04-26T06:47:21Z","snapshot_observed_at":"2026-08-03T16:26:26.684826Z","submitted_at":"2024-10-09T17:55:02Z","title":"Towards Interpreting Visual Information Processing in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2410.07149","doi":"10.48550/arxiv.2410.07149","metadata_source":"pith","pith_arxiv_id":"2410.07149","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Towards interpreting visual infor- mation processing in vision-language models","venue":"cs.CV","work_id":"51ff39e4-3945-4ac9-8659-7710852e0904","year":2024},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2410.07149","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:fbce7d5a4acdfe2f8e03170a63719960ca83b81117182be7e0def23e23eff610","observation_id":"371aaf5a-e7ce-4e94-a9bb-1f0b438d264e","resolution":{"observed_at":"2026-05-13T21:58:19.838229Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2506.09047","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T05:54:33.552693Z","title":"Same task, different circuits: Disentangling modality-specific mechanisms in vlms.arXiv preprint arXiv:2506.09047, 2025a","venue":null,"work_id":"5d1afffb-f173-4dfd-b666-e74e2531ac66","year":2025},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:bff5e544300e034a5d5939d87ea8494c9a58340f4c05a4dd87a1a9f2a7732943","observation_id":"09d240dc-382a-4b3a-960b-7816365a41d2","resolution":{"observed_at":"2026-05-13T21:58:19.871151Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:d108576359078c73dbb8c51bf220fa169a78cc2ea90fd8b05c451f045bb4e1ce","observation_id":"18e68879-6792-4449-8486-0ba08abb84e7","resolution":{"observed_at":"2026-05-13T21:58:19.865213Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15952","last_updated":"2024-08-09T14:26:02Z","snapshot_observed_at":"2026-07-06T17:49:36.858294Z","submitted_at":"2024-03-23T23:06:32Z","title":"IllusionVQA: A Challenging Optical Illusion Dataset for Vision Language Models","version":3},"cited_work":{"arxiv_id":"2403.15952","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.15952","snapshot_observed_at":"2026-07-01T22:26:18.101110Z","title":"Illusionvqa: A challenging optical illu- sion dataset for vision language models","venue":null,"work_id":"d7b0d22a-4aaa-4023-819f-a412d03a752a","year":2024},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2403.15952","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:ff2da7433d1d3d6a15aa9b5deee61973a995229ae6e1274ffead4935257978c5","observation_id":"c470afb2-a3ab-46ec-9af8-360ac8356a35","resolution":{"observed_at":"2026-05-13T21:58:19.876482Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-04T04:40:00.850270Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":"2403.14624","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-07-03T20:48:56.007587Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","venue":"cs.CV","work_id":"5ac1378a-eb29-4156-b54f-ca50bf47e594","year":2024},"citing_paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T21:56:29.924506Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2604.02486"},"observation_digest":"sha256:c81a72f1330c1b04643e2401147da8ce7de887aaacb772953a69e54256ba08ee","observation_id":"7b7107e0-08f7-4343-a956-fe77e65f4de8","resolution":{"observed_at":"2026-05-17T01:29:30.364997Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2604.02486","last_updated":"2026-04-15T13:13:04Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T08:35:10.757139Z","submitted_at":"2026-04-02T19:40:56Z","title":"VLMs Need Words: Vision Language Models Ignore Visual Detail In Favor of Semantic Anchors"},"reference_resolution":{"displayed":16,"state_counts":{"malformed_identifier":0,"metadata_mismatch":5,"parse_uncertain":0,"unresolved":0,"verified_exact":11,"verified_fuzzy":0},"total_outbound_references":16},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 4 August 2026, this Paper Citation Record lists 16 of 16 outbound references and 3 inbound Pith citation observations for arXiv:2604.02486."}