{"as_of":"2026-08-14T17:37:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:38a1dbb33e7735595574bc16e993ff6a498a325641ccc9b06b1a6905e1580324","coverage":[{"denominator":73,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":73,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T00:13:15.367545Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.26326/citation-record","integrity":"/paper/2607.26326/integrity","json":"/paper/2607.26326/citation-record.json","paper":"/paper/2607.26326"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:09.842361Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:09.842361Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:e219f1a4046e5185e3bc6b462f97c9b2200a3e4e177515f2e26f75f99738c4d2","observation_id":"0ccf8c7c-3489-4d68-adc6-90d2b643b223","resolution":{"observed_at":"2026-08-01T00:13:09.842361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.02770","last_updated":"2026-07-02T21:08:53Z","snapshot_observed_at":"2026-08-13T20:57:43.825707Z","submitted_at":"2026-07-02T21:08:53Z","title":"Gemma 4 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.02770","snapshot_observed_at":"2026-08-01T00:13:09.923293Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:09.923293Z"},"links":{"cited_paper":"/paper/2607.02770","citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:3eeeae5e5e91144fb93ba9d0ea916047aa32f8b4720da4ce7370e31a69639161","observation_id":"b7b75f1f-a283-4aa7-821a-33b7136ef599","resolution":{"observed_at":"2026-08-01T00:13:09.923293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.012366Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.012366Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:493fb0efdf06d37663821ff1316658d5fa6de17e5c024c8a48dfa344cada54a4","observation_id":"b487c4ec-0c62-4f9b-aa35-1d2d52ed0182","resolution":{"observed_at":"2026-08-01T00:13:10.012366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.095484Z","title":"Proceedings of the 38th International Conference on Machine Learning , pages =","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.095484Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:6e36d14d17e3335a35f08f6eff9f0d555a64f94f0169827e6309e0bcdc91f40e","observation_id":"910369bf-2559-42a9-aa8a-bb44823d356f","resolution":{"observed_at":"2026-08-01T00:13:10.095484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.155985Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.155985Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:f8b77ff2f5611118ee68d7de414f757de388fbfab0e49e347bedc3fa5fed265e","observation_id":"b423aee0-981d-42a7-9cd5-a6d51cd9b0c2","resolution":{"observed_at":"2026-08-01T00:13:10.155985Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.225148Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) , pages=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.225148Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:d91d8ad5020db4c9e72ef17caa73618c35206204c29b79a7d139b418d9af1077","observation_id":"d3628eac-303f-4e75-895a-f180bf1761a1","resolution":{"observed_at":"2026-08-01T00:13:10.225148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.298000Z","title":"(No Title) , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.298000Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:0bc5857e85d4334fc9ce63c1e09547814c1e8f2f21cfcc094a5211ad7636c933","observation_id":"84005604-d1cd-4dd6-89a8-894510332df7","resolution":{"observed_at":"2026-08-01T00:13:10.298000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.384660Z","title":"2022 , editor =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.384660Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:74a2d1d1b8356797e06f8590e8037a127be13ea8bf4347630aa3645faa033d12","observation_id":"95976a2e-11ce-4173-b4d4-91158602ff6e","resolution":{"observed_at":"2026-08-01T00:13:10.384660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.469896Z","title":"Flamingo:","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.469896Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:19aed609f0e0b653fc5d6f553a1e54dfe2baa10dc2dd370d32027c512e4d53c8","observation_id":"b6fff76e-b15b-4274-ba0d-cc8185c4b826","resolution":{"observed_at":"2026-08-01T00:13:10.469896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.533427Z","title":"Advances in Neural Information Processing Systems , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.533427Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:bc37c697eb00414d9626b5b7bba57a79303acf40b094c9366480d686dbabf169","observation_id":"aa11c4b2-4e56-41a9-99f5-aff3889b1504","resolution":{"observed_at":"2026-08-01T00:13:10.533427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.598017Z","title":"Advances in Neural Information Processing Systems , editor =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.598017Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:42752f8631a56147c30077874eb680680cacaf4049576c131571934c2067b8b7","observation_id":"f9db17bb-3a6a-4819-bc23-035718b2b3f5","resolution":{"observed_at":"2026-08-01T00:13:10.598017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.664105Z","title":"2023 , editor =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.664105Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:31013a0213bbc3983fa12d6ad7a72eae13d9aa31b24143a070732fe184d03d2e","observation_id":"18ecdcb4-f389-4f5e-b456-267b36449c61","resolution":{"observed_at":"2026-08-01T00:13:10.664105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-01T00:13:10.735781Z","title":"arXiv preprint arXiv:2502.14786 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.735781Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:c19e0ff7ecfede5cec3b9542dcb7e81edfd5fd0d19f91c1981b5b31f5afecb99","observation_id":"1b6d5171-d043-4a90-88c9-d8a9080012fb","resolution":{"observed_at":"2026-08-01T00:13:10.735781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.801958Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.801958Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:0e9ea64338848f2ced1935f6e869f4e552ff1c8369c50e1a89f06b17d4a80d01","observation_id":"62a46523-e4b3-470e-a7f6-09f85696c35b","resolution":{"observed_at":"2026-08-01T00:13:10.801958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.882439Z","title":"Eyes Wide Shut?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.882439Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:9bec09f33d5d1ab3c7e129b5d97d91e5620f1105437b5e8a4cbc2ede123c7e20","observation_id":"4f59c5cc-450a-4115-a22c-c6f7ed76bde2","resolution":{"observed_at":"2026-08-01T00:13:10.882439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:10.969920Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:10.969920Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:01037a73b299d5c116260c78399d32612240766385f1a8dbdce2c72b8015a81e","observation_id":"b1403138-f2d6-45c5-89e3-cd1fc1194b53","resolution":{"observed_at":"2026-08-01T00:13:10.969920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.059086Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.059086Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:4264a62ecd579bb59333b2a70b3a49862032bd12ed55244e071995c51f7852d1","observation_id":"4b6a5762-daaa-424c-9f5e-81436e38fd5c","resolution":{"observed_at":"2026-08-01T00:13:11.059086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.139457Z","title":"arXiv preprint arXiv:2603.03276 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.139457Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:7b339550f99791c6505e16cef65f9035d4556540913a5df21970141fed92fdc8","observation_id":"2eb86cb6-c5a3-450c-beb2-30fc93f09761","resolution":{"observed_at":"2026-08-01T00:13:11.139457Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.221493Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.221493Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:ae501c88ddcde5d28e2ccccf97a46b5e5d9e3e4117db29ad01e678c6327064ea","observation_id":"4f136fb6-08b8-419a-9a78-10f237ebd3e4","resolution":{"observed_at":"2026-08-01T00:13:11.221493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.280707Z","title":"arXiv preprint arXiv:2512.02014 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.280707Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:75e7fdaaa140ac978e7701c57a76de0e953089a9ba4f45090384a9da0e63feaf","observation_id":"664085ba-13fd-4f02-aad8-862a92176332","resolution":{"observed_at":"2026-08-01T00:13:11.280707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.338143Z","title":"2024 , doi =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.338143Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:80c5cc2032c819529d09bc63ff676b66086566e8fa14e0ac37d79d36bc076419","observation_id":"92631c34-1e16-47e3-ab05-989c76851296","resolution":{"observed_at":"2026-08-01T00:13:11.338143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.11690","last_updated":"2025-10-13T17:51:39Z","snapshot_observed_at":"2026-08-13T23:51:28.874833Z","submitted_at":"2025-10-13T17:51:39Z","title":"Diffusion Transformers with Representation Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.11690","snapshot_observed_at":"2026-08-01T00:13:11.391077Z","title":"arXiv preprint arXiv:2510.11690 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.391077Z"},"links":{"cited_paper":"/paper/2510.11690","citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:d2f804bafc3c2345a112a1b0857a89ce8663176a870002120d20442bd9ab273f","observation_id":"9211bc7d-11af-42f5-b615-e1e5926d1f7a","resolution":{"observed_at":"2026-08-01T00:13:11.391077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.469442Z","title":"Hidden in plain sight:","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.469442Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:60911dba036e7ba404e0546cce601487467218e010b58638d3f2c7e6775e6176","observation_id":"1fe5fe08-ffc9-41ca-abba-0cdd746e2954","resolution":{"observed_at":"2026-08-01T00:13:11.469442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.549910Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.549910Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:fe81e83f3003baf7b730f4421ad2193868827f13ca6a041af2e3d98db8bc3dba","observation_id":"d47ce39c-c931-44a8-9850-0de634ea6718","resolution":{"observed_at":"2026-08-01T00:13:11.549910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.625364Z","title":"Context-faithful Prompting for Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.625364Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:a8f23c1fa4cd87e7f088d2548eed2976d9df83ae4c29cf969ec236a364df2e33","observation_id":"414fb9d9-d763-4a43-8672-7c7b9db70454","resolution":{"observed_at":"2026-08-01T00:13:11.625364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.703423Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.703423Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:bd1c4fd82d8a4cdc892b0f4621775b4462fdd484a338d37fd9a6b143a09a504a","observation_id":"9fa0abda-4a42-4b5f-8094-728d8024a6ec","resolution":{"observed_at":"2026-08-01T00:13:11.703423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.782392Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.782392Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:b3d260792ceb8a483db3cafdb2ed86f7a56191a7bae0d7d0486746dc0721e605","observation_id":"832e7f14-080d-4a76-9621-eeb22e79db27","resolution":{"observed_at":"2026-08-01T00:13:11.782392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.861495Z","title":"Copyright Violations and Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.861495Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:e25caf3d7d8d535a9d47c0913377a49bafbb01073556a184f21ad97444bce873","observation_id":"0a85dc38-d652-4898-8c37-eba9bf85723d","resolution":{"observed_at":"2026-08-01T00:13:11.861495Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.923173Z","title":"Findings of the association for computational linguistics: ACL 2023 , pages=","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.923173Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:27d744a5bf9d2b4122a3510a701fb51b8ac418b2b2b46423304cfce01f0810a4","observation_id":"1d35855a-6928-4ec3-b79d-c6913fa663bf","resolution":{"observed_at":"2026-08-01T00:13:11.923173Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:11.994621Z","title":"Mitigating Object Hallucinations in Large Vision-Language Models through Visual Contrastive Decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:11.994621Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:012df6da7d50a99a6312d4c8f7650218aa9cdc99d7e7cd35264cb557330d66d4","observation_id":"e2512a93-2ef9-4149-83d9-2e80c8419fe1","resolution":{"observed_at":"2026-08-01T00:13:11.994621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.092133Z","title":"The Thirteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.092133Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:fd49ecde07aeaf4838f125d7a2d34cfb739b62869ffaf4f0cad439295c740dd4","observation_id":"0c537931-47fe-4536-8821-6ffa8a5824ea","resolution":{"observed_at":"2026-08-01T00:13:12.092133Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.149111Z","title":"Glass and Pengcheng He , booktitle=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.149111Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:6d53f78bdbad003396bdc88f3beab2aac7b5bf7a84652f1887327cb908b185a6","observation_id":"d0cdb115-e6cb-49cd-a1f7-a5adf2845606","resolution":{"observed_at":"2026-08-01T00:13:12.149111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.208109Z","title":"Aho and Jeffrey D","venue":null,"work_id":null,"year":1972},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.208109Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:3c4fa56df83fda83e1f74844110a8e5fd9300016691327af257d3e5650c5accd","observation_id":"e5297999-aa78-45fe-b4fb-d58a124fb1a6","resolution":{"observed_at":"2026-08-01T00:13:12.208109Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.287628Z","title":null,"venue":null,"work_id":null,"year":1983},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.287628Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:18eab66ea4254aea499cb164c70062ee25b3bb699c783440929d22a954cbf18e","observation_id":"47f809a0-8fb6-4174-8c68-a2a8de79d583","resolution":{"observed_at":"2026-08-01T00:13:12.287628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.353819Z","title":"Chandra and Dexter C","venue":null,"work_id":null,"year":1981},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.353819Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:986a207c9f67fde46f098a0a2122f7db3ce5c772ee9f4a48187cae1344b75d43","observation_id":"ec2c1c73-a7d6-4886-b6fb-425e99672c94","resolution":{"observed_at":"2026-08-01T00:13:12.353819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.438844Z","title":"Scalable training of","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.438844Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:7f5529af3381e0b5668be9564031a1fce4fa8876cd50360038cb77ed7ea69bae","observation_id":"fb841ff3-0226-49ce-b123-0fd26c8bdfc7","resolution":{"observed_at":"2026-08-01T00:13:12.438844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.545066Z","title":null,"venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.545066Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:bc14741947c8aee23cbd624caf62f82ef80c63530708aa383a5cbfca63dc84d3","observation_id":"67bff66b-4601-4b71-af52-162f30fd843d","resolution":{"observed_at":"2026-08-01T00:13:12.545066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.615882Z","title":"Tetreault , title =","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.615882Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:fef45c01bc53319c7e5e25c805120dec2cd19e77a7e8700bbf2c1b3d143f1287","observation_id":"74c925e2-4f10-4bb6-8e8c-57dfa12a591b","resolution":{"observed_at":"2026-08-01T00:13:12.615882Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.686570Z","title":"A Framework for Learning Predictive Structures from Multiple Tasks and Unlabeled Data , Volume =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.686570Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:a6c819f710f7d5e686ce254fa5a3a6988422047fa953fa15bf417c8c9f4b1bf3","observation_id":"9c988ef6-6f60-4b6b-a8c3-5597a231edcf","resolution":{"observed_at":"2026-08-01T00:13:12.686570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.758309Z","title":"2024 , doi=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.758309Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:27a1c2e6217342cf44d6d29fade34e765fc953fe9e353094f51ced018946eb3b","observation_id":"c9e73f2c-1660-462d-a86f-0088bc9446c6","resolution":{"observed_at":"2026-08-01T00:13:12.758309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.834873Z","title":"2024 , url=","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.834873Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:a35107d697ce26e5142c0461634d765d069dce1b795388569e20c88ddeec6abc","observation_id":"9175f5fc-4d48-4e19-831e-acac83db6132","resolution":{"observed_at":"2026-08-01T00:13:12.834873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.882556Z","title":"Transfer between Modalities with","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.882556Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:be49acdbc27a54aec1b5f2ee61c5e0a94ad55ffd87c88d9795d84c4fae298f43","observation_id":"25c9e551-5903-4b19-8a14-0eb5d6779a4f","resolution":{"observed_at":"2026-08-01T00:13:12.882556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:12.939453Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:12.939453Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:3e44b75b2e1a92c128137401572ba6e6dfc03a8463065d2617d67bc10afa7f15","observation_id":"cca88b54-17f8-4a69-82f2-cbf1173cc5d7","resolution":{"observed_at":"2026-08-01T00:13:12.939453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.001910Z","title":"2026 , url=","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.001910Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:27f84b208b7b1afcaa80e78044b88d1cfbaf757ed9809e7b42d4516cfae047f4","observation_id":"b2255361-d862-4368-acd4-e031019e462a","resolution":{"observed_at":"2026-08-01T00:13:13.001910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.054833Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.054833Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:666e890b6358a1345343f8fc83acd08fcc293d7bc903a858699cd17a7e2d5412","observation_id":"5e8e5c8b-c4e8-452c-a8f8-0bbdab1d3d81","resolution":{"observed_at":"2026-08-01T00:13:13.054833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.115747Z","title":"Auto-encoding variational","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.115747Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:665fc0d8965e0191bb9eca3e6c05b35cc6e0db3f37d9e975a6e3069e3f4790a7","observation_id":"e7faeabd-24cf-4d46-819a-c49160be9bc0","resolution":{"observed_at":"2026-08-01T00:13:13.115747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.182783Z","title":"International Conference on Learning Representations , volume=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.182783Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:7ab1396c20c0c16f29b6b5d5bfa85ff34d1bbcb695109049b132511f8dc055fe","observation_id":"f45236fe-4298-4598-be09-663110e02368","resolution":{"observed_at":"2026-08-01T00:13:13.182783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.244115Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.244115Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:d68efa8ffeb0d73c6a9aae17735fbc8da8dd010911338b66997f0a4ad2e7c908","observation_id":"4e5cbc8a-5af0-4400-9a32-3005e251cbad","resolution":{"observed_at":"2026-08-01T00:13:13.244115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.310093Z","title":", author=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.310093Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:333a971d841dd4ba58f0439be7dfed020c74d8983639e9ce6bbcd1d8e832dc52","observation_id":"0cd07c96-6e73-49c5-b34e-10d3633de3e4","resolution":{"observed_at":"2026-08-01T00:13:13.310093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.361805Z","title":"The Fourteenth International Conference on Learning Representations , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.361805Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:a04d0060d8e4a1dd0115b982d6cc274c68910e43755d2c4e504cbcc3ae5cac3e","observation_id":"b6083585-9c5e-4f09-add9-dcc09c9bbf75","resolution":{"observed_at":"2026-08-01T00:13:13.361805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.423914Z","title":"VL ind-Bench: Measuring Language Priors in Large Vision-Language Models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.423914Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:06a6c03e9e3bc49f7f4bc07c0c09a43de5a04cf731556f14d16562d6f3570c76","observation_id":"5d861501-2f06-4f0b-9eb4-55de9c4c8232","resolution":{"observed_at":"2026-08-01T00:13:13.423914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.505397Z","title":"2025 , url=","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.505397Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:cd6c5068b4a7bfbd27c34f085073150a0f2aed95d08b760213f2284a5354b253","observation_id":"08519e15-7219-4f0c-b7bb-d4ff1ab24777","resolution":{"observed_at":"2026-08-01T00:13:13.505397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.539568Z","title":"and Bar, Amir and Singh, Ritambhara and Eickhoff, Carsten","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.539568Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:8413d4132200a8944749da92e5d531eb18bb00cd4ba9d06b1fa77f931382c81c","observation_id":"f0a677dd-9dc0-4dc5-88fd-fa8d6487ee01","resolution":{"observed_at":"2026-08-01T00:13:13.539568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.findings-emnlp.683","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ROME : Evaluating Pre-trained Vision-Language Models on Reasoning beyond Visual Common Sense","venue":null,"work_id":"519efb0b-6854-455a-a69a-28deb188ef3a","year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.556259Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:4f090fd9480093c9d4ab14594d3176c46c40a9ea3fc4195493d735a8f99d51d2","observation_id":"97dcdc19-2745-4bc6-bbf9-805f71b60bad","resolution":{"observed_at":"2026-08-01T00:16:14.874294Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.657915Z","title":"Characterizing Mechanisms for Factual Recall in Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.657915Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:fa1f6dbf3065610c86d9ee7b55beeebd5322bcc10e717f0869c9038e47824ef5","observation_id":"f1a95946-80d5-47b9-9ff4-eb9f75b297cf","resolution":{"observed_at":"2026-08-01T00:13:13.657915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.758516Z","title":"Activation Scaling for Steering and Interpreting Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.758516Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:6c9c5f8de6cd1df4e79418ac0479807a2c8da6cfba7bd3e46df5721868991d27","observation_id":"2f99b3a7-a02b-4770-abb6-8f94928dc089","resolution":{"observed_at":"2026-08-01T00:13:13.758516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.842678Z","title":"A Glitch in the Matrix ? Locating and Detecting Language Model Grounding with Fakepedia","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.842678Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:0688afc13745d31c46f831af5fdae5527c80ad32060a112c2ee247bf8001a8ae","observation_id":"333d0f76-a160-49a6-bc16-8a518c9199ac","resolution":{"observed_at":"2026-08-01T00:13:13.842678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.890107Z","title":"International Conference on Machine Learning (","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.890107Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:07c0910b412c1e038ef0585c831b4e4f19d7f1fb55e5d45989d77e89f5ceeb0a","observation_id":"29fe374e-bfa1-49a1-99f2-37a5a6ac3f6d","resolution":{"observed_at":"2026-08-01T00:13:13.890107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:13.928509Z","title":"2009 , pages=","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:13.928509Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:0df4a03baff90613625c634ba79212bcfb72ce5dafb05633c54ebb17a1d15a3f","observation_id":"43c93d88-791a-4587-a1c2-5c90c6d9f638","resolution":{"observed_at":"2026-08-01T00:13:13.928509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.009568Z","title":"Interpretability in the Wild:","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.009568Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:9867821eea3c3a32196282a06bc70a48945ed1f4dfbac02e3d29cb2f357a471b","observation_id":"44f8bd7d-e5fc-4e0d-b98a-f913eb2635a7","resolution":{"observed_at":"2026-08-01T00:13:14.009568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.088574Z","title":"Probing Visual Language Priors in","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.088574Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:64364023c3b929f358e900a0558d55d897c499e05fae91dff48f5f0878c29fe7","observation_id":"612c4b22-e8ad-4b63-92d6-d4c4279b5772","resolution":{"observed_at":"2026-08-01T00:13:14.088574Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.10248","snapshot_observed_at":"2026-08-01T00:13:14.164799Z","title":"arXiv preprint arXiv:2308.10248 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.164799Z"},"links":{"cited_paper":"/paper/2308.10248","citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:78679778f09a2d4f39e38025a141c52c0b3238bbfe68ee39eaa7f55ecb699f32","observation_id":"81a85eb0-27f6-42f1-861c-71d6473581c8","resolution":{"observed_at":"2026-08-01T00:13:14.164799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.273315Z","title":"and Wang, Zifan and Mallen, Alex and Basart, Steven and Koyejo, Sanmi and Song, Dawn and Fredrikson, Matt and Kolter, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.273315Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:d3287078349ee7e026e656125ff1444bc6bf8a51ecb7ff7c825999a9e190e127","observation_id":"00ffaf42-7708-4387-8627-5c562e590520","resolution":{"observed_at":"2026-08-01T00:13:14.273315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.331436Z","title":"Proceedings of the Third Conference on Causal Learning and Reasoning , pages =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.331436Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:ed4a618e39187d099c988c3471e7016c744d3d81d823cdd7390580c9f7d80920","observation_id":"a7388b18-5804-4b6d-b312-dc28ed9eba99","resolution":{"observed_at":"2026-08-01T00:13:14.331436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.425106Z","title":"Entity-Based Knowledge Conflicts in Question Answering","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.425106Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:bd878b955ded753560e99efad8583a53d3f5ed7fdc4a31dcaf745d4dadb8d010","observation_id":"1e338a5d-47e9-40d9-a15e-2e0344dd05cb","resolution":{"observed_at":"2026-08-01T00:13:14.425106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.533536Z","title":"Workshop on Responsibly Building the Next Generation of Multimodal Foundational Models , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.533536Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:45177039276e54ab845c2888b112814dcf827dd9b5a080e094b699ac0d2c9663","observation_id":"6142a99f-3150-4e3e-b9b2-5480d5d10b3f","resolution":{"observed_at":"2026-08-01T00:13:14.533536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.acl-long.503","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Understanding Retrieval Robustness for Retrieval-augmented Image Captioning","venue":null,"work_id":"bcf59de6-5541-4d00-b2d7-29191b781b94","year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.663572Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:a6c693361b4d3f9dd5804b67b13f7ad029db024b1627b20dab341949feb1a867","observation_id":"706ee78c-78ca-4427-80b4-f1dd60c88a62","resolution":{"observed_at":"2026-08-01T00:16:14.719348Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.769727Z","title":"Position:","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.769727Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:77d37f02a70b1c91966092826f529c56e5274eee4f7428c30b0c028c977b7a00","observation_id":"86c0618a-5e43-42dc-8352-4c7314ec181a","resolution":{"observed_at":"2026-08-01T00:13:14.769727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:14.910017Z","title":"Do Vision and Language Models Share Concepts?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:14.910017Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:74ba10319ae12b79be77452099eafdb6b5a7fd1df8bede096ad73800e73507b3","observation_id":"36f6e457-a25f-4f20-9a94-2d9240f1f508","resolution":{"observed_at":"2026-08-01T00:13:14.910017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:15.056648Z","title":"Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV) , month =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:15.056648Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:b2c921f7ac6f9070b7a43e03075a38a5221748fc0fb54c811b14959ddb461320","observation_id":"9f0fbfb4-ce1a-44ad-bd3c-5c35e2dde9a7","resolution":{"observed_at":"2026-08-01T00:13:15.056648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:15.179630Z","title":"F oodie QA : A Multimodal Dataset for Fine-Grained Understanding of C hinese Food Culture","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:15.179630Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:7f38f7706c42ec72c414ba41dd4cff2c2a5ad03d0a89aec53ac59def738fc18a","observation_id":"3d0e2560-ab0a-459d-916d-e9f684a2c139","resolution":{"observed_at":"2026-08-01T00:13:15.179630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-emnlp.673","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"What if Othello -Playing Language Models Could See?","venue":null,"work_id":"2d22b90d-2ba5-4816-bf80-4904338fad1f","year":2025},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:15.289611Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:5bf323598c01a9dd00ff2e434009014b3fb4bfe2357ed6f3cef7c0f75ed6243b","observation_id":"a08553a4-1e69-4ce1-8779-0663cbeb8c51","resolution":{"observed_at":"2026-08-01T00:16:14.550006Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T00:13:15.367545Z","title":"Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition , pages=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-01T00:13:15.367545Z"},"links":{"citing_paper":"/paper/2607.26326"},"observation_digest":"sha256:f8e31dcf4cc1afd68de2e76c54c1d5e5347a2d0328d526b8a64c8b0cda5906de","observation_id":"27fe734f-35dc-4279-8cfc-8d09ce1fd985","resolution":{"observed_at":"2026-08-01T00:13:15.367545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.26326","last_updated":"2026-07-28T22:52:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-09T14:18:57.972294Z","submitted_at":"2026-07-28T22:52:34Z","title":"Seeing or Knowing? Visual Context Sensitivity in Multimodal Large Language Models"},"reference_resolution":{"displayed":73,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":70,"verified_exact":3,"verified_fuzzy":0},"total_outbound_references":73},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 73 of 73 outbound references and 0 inbound Pith citation observations for arXiv:2607.26326."}