{"as_of":"2026-08-09T09:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da19f22adf67c15ec6ef2b7ac06ebb26e0ee2b4eb1cc7aca384b27b2da2dbe78","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:47:07.903561Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T01:00:26.919995Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T17:15:52.016694Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-08-06T01:00:26.919995Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.04017","last_updated":"2025-08-06T02:13:46Z","snapshot_observed_at":"2026-08-07T23:48:57.602257Z","submitted_at":"2025-08-06T02:13:46Z","title":"Can Large Multimodal Models Actively Recognize Faulty Inputs? A Systematic Evaluation Framework of Their Input Scrutiny Ability","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T01:00:26.919995Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2508.04017"},"observation_digest":"sha256:b4dd0e903d9cf7c63c7e2140e7b5258ab3d9dfd4d66ff552cc1a7e6631ebeeca","observation_id":"f9767cf6-0900-4952-9bfb-3c0ca9bc9db0","resolution":{"observed_at":"2026-08-06T01:00:26.919995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":"2507.01790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-07-01T17:15:52.016694Z","title":"How do vision- language models process conflicting information across modalities?","venue":null,"work_id":"05af1409-c0b7-48de-854b-1f72ca1b5dcb","year":2025},"citing_paper":{"arxiv_id":"2511.18359","last_updated":"2026-04-07T10:36:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-23T09:12:48Z","title":"TRANSPORTER: Transferring Visual Semantics from VLM Manifolds","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-17T05:59:14.478279Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2511.18359"},"observation_digest":"sha256:8ca2f61dfb31c22860f3ec984d0aee74ebdd389c8b6f8ba762a98bdb4fb5846e","observation_id":"0c9086df-9a57-439d-a560-1ad63b475312","resolution":{"observed_at":"2026-05-17T06:01:34.739667Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":"2507.01790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-07-01T17:15:52.016694Z","title":"How do vision- language models process conflicting information across modalities?","venue":null,"work_id":"05af1409-c0b7-48de-854b-1f72ca1b5dcb","year":2025},"citing_paper":{"arxiv_id":"2604.16902","last_updated":"2026-04-29T05:22:54Z","snapshot_observed_at":"2026-08-02T23:46:35.225613Z","submitted_at":"2026-04-18T08:25:52Z","title":"Beyond Text-Dominance: Understanding Modality Preference of Omni-modal Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T07:02:02.752466Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2604.16902"},"observation_digest":"sha256:90734c84acf32cefd788e99a0440f3903520309b63d83ddbe25025aa178161b2","observation_id":"524773b5-315c-4eac-8bf8-a010888435df","resolution":{"observed_at":"2026-05-10T07:11:53.710872Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":"2507.01790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-07-01T17:15:52.016694Z","title":"How do vision- language models process conflicting information across modalities?","venue":null,"work_id":"05af1409-c0b7-48de-854b-1f72ca1b5dcb","year":2025},"citing_paper":{"arxiv_id":"2606.28273","last_updated":"2026-06-26T17:16:04Z","snapshot_observed_at":"2026-07-07T00:02:24.342539Z","submitted_at":"2026-06-26T17:16:04Z","title":"Vision-Default, Prior-Override: Causal Mechanisms of Perception-Knowledge Conflict in Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T03:53:04.984303Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2606.28273"},"observation_digest":"sha256:4ad130aadf30b557666aa721d26604bdbb4ccb118693ee370494ac479b780e23","observation_id":"854e9a80-1a6a-48de-8edb-a3c3607b15ab","resolution":{"observed_at":"2026-07-01T17:15:52.018576Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":"2507.01790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-07-01T17:15:52.016694Z","title":"How do vision- language models process conflicting information across modalities?","venue":null,"work_id":"05af1409-c0b7-48de-854b-1f72ca1b5dcb","year":2025},"citing_paper":{"arxiv_id":"2606.29579","last_updated":"2026-06-28T19:48:39Z","snapshot_observed_at":"2026-07-31T02:44:46.646016Z","submitted_at":"2026-06-28T19:48:39Z","title":"ScAle: Attention Head Scaling as a Minimal Adapter for Spatial Reasoning in Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T07:06:36.599771Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2606.29579"},"observation_digest":"sha256:297f8af8b4d6f2119491a8d5abcb3e593166872705d723cfe214128a94e0d1c4","observation_id":"cf1015e8-e448-412d-a1fd-3f9e5624e96b","resolution":{"observed_at":"2026-06-30T07:14:21.583728Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-07-12T00:17:46.528896Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?arXiv preprint arXiv:2507.01790, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.03738","last_updated":"2026-07-04T06:53:35Z","snapshot_observed_at":"2026-08-08T15:43:17.288449Z","submitted_at":"2026-07-04T06:53:35Z","title":"Attending to Multimodal Generation One Token at a Time","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-12T00:17:46.528896Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2607.03738"},"observation_digest":"sha256:521a4f0ba980a1ff1246472e3b999dee2e7c5ad7c494bf37fe33efa2ea3231e1","observation_id":"218f5833-c688-4f6d-b7e9-af96fcff062a","resolution":{"observed_at":"2026-07-12T00:17:46.528896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.01790","snapshot_observed_at":"2026-08-04T01:41:52.790018Z","title":"arXiv preprint arXiv:2507.01790 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.00035","last_updated":"2026-07-21T06:06:20Z","snapshot_observed_at":"2026-08-06T23:11:32.830225Z","submitted_at":"2026-07-21T06:06:20Z","title":"Linguistic Context Recodes Visual Representations in Vision-Language Models","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-04T01:41:52.790018Z"},"links":{"cited_paper":"/paper/2507.01790","citing_paper":"/paper/2608.00035"},"observation_digest":"sha256:de5e8e903307f8f566784d031bdc988f245c9bfdea030b5bb25a8226de562e4e","observation_id":"a0acd5ca-061f-4b96-8016-9cd40cbb5726","resolution":{"observed_at":"2026-08-04T01:41:52.790018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2507.01790/citation-record","integrity":"/paper/2507.01790/integrity","json":"/paper/2507.01790/citation-record.json","paper":"/paper/2507.01790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:11.687811Z","title":"Multimodal biomedical ai","venue":null,"work_id":"f0dc263d-274c-4924-8eb3-791e83445155","year":2022},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.167374Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:14f6ddea95a8ba2e9809c03234af8dd7c474c5cfb9be3918d4efd5ad2ef4ec48","observation_id":"81f33fad-f608-4169-ab62-9fcec184c70b","resolution":{"observed_at":"2026-08-06T20:47:11.775843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-07-06T05:13:30.860932Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-06T20:47:03.208420Z","title":"Understanding intermediate layers using linear classifier probes","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.208420Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:86d3e14b7d82af9aa728c56a051baca4fb17984718cc3ecad53d418e39aa39a4","observation_id":"6d595cf1-56ec-47b9-ba72-ddeadc186849","resolution":{"observed_at":"2026-08-06T20:47:03.208420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:11.678892Z","title":"Flamingo: a visual language model for few-shot learning","venue":null,"work_id":"84ead4e8-99ee-4936-9252-62c8547338e8","year":2022},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.286867Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:cd68e277be0ec3057da53654dcf89c078350ffacca1277e1af3988efa5d6ead7","observation_id":"8c09864a-642d-4096-b634-7f795a35f720","resolution":{"observed_at":"2026-08-06T20:47:11.681952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-06T20:47:03.368750Z","title":"Qwen2.5-vl technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.368750Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:e6950b62ba3e060d3bc9a0c5da2cdae22869c7167d6f1837be5673ec5620ea63","observation_id":"26f38637-60c2-403e-8948-5ecb129deaba","resolution":{"observed_at":"2026-08-06T20:47:03.368750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:03.435165Z","title":"Probing classifiers: Promises, shortcomings, and advances","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.435165Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:dc90c4601cdb52c933db048f7582d779e16e2914443080a80930b2f005c2d7c2","observation_id":"04f238e6-90fb-493e-80c5-fe5d5fd89292","resolution":{"observed_at":"2026-08-06T20:47:03.435165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:11.669197Z","title":"On the robustness of large multimodal models against image adversarial attacks","venue":null,"work_id":"e30d7837-7d42-4e86-9c7e-d34020715f0f","year":2024},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.567710Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:4d38ac7d9cc3caaf79a77d1a06fdea14b466dc6004e41c2d84817d5861c8764e","observation_id":"a8ff95b2-42ca-4a9b-a95a-f968dcc63c28","resolution":{"observed_at":"2026-08-06T20:47:11.672456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:11.605891Z","title":null,"venue":null,"work_id":"7226678a-9909-43de-a919-7e7fa8e8544b","year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.705815Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:96e74b245ac3cee23eb47dda5848f7d9a39f0df730fdc75138b7f29389dc74f1","observation_id":"5dd82d92-11e5-4409-87d0-506b45b03509","resolution":{"observed_at":"2026-08-06T20:47:11.661002Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02199","last_updated":"2025-03-04T02:21:07Z","snapshot_observed_at":"2026-08-07T17:31:49.776715Z","submitted_at":"2025-03-04T02:21:07Z","title":"Words or Vision: Do Vision-Language Models Have Blind Faith in Text?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02199","snapshot_observed_at":"2026-08-06T20:47:03.900892Z","title":"Words or vision: Do vision-language models have blind faith in text?, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:03.900892Z"},"links":{"cited_paper":"/paper/2503.02199","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:d335cc7016e606ebb6baade5aabbc20264f92d0c52f3c8a61f0b74d6a2b200bc","observation_id":"921bb0d0-f044-467b-b493-b92e6524b6c4","resolution":{"observed_at":"2026-08-06T20:47:03.900892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:04.064194Z","title":"Imagenet: A large-scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:04.064194Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:3e45307b536d456447abfb9bee38157da8b4ade8bb9413bc2f92176b41a163e3","observation_id":"f7efe53c-d129-4982-91bd-484f48087a92","resolution":{"observed_at":"2026-08-06T20:47:04.064194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:04.232791Z","title":"The pascal visual object classes (voc) challenge","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:04.232791Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:52d45009682b837bf4b6cd98d348692ef481420ec5c23b1a40632bbad33a8c8c","observation_id":"1b330963-4990-4baa-a8ad-3333f6fcf127","resolution":{"observed_at":"2026-08-06T20:47:04.232791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:04.394039Z","title":"Pixels versus priors: Controlling knowledge priors in vision-language models through visual counterfacts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:04.394039Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:c2eb800351d208df39e535c41a748bd1165e09d6ef79477743a5aa7874db3256","observation_id":"d8e1b6d8-03f9-410f-b75b-59f6b38387d5","resolution":{"observed_at":"2026-08-06T20:47:04.394039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:11.180939Z","title":"What do VLM s NOTICE ? a mechanistic interpretability pipeline for G aussian-noise-free text-image corruption and evaluation","venue":null,"work_id":"be17cb41-ed63-4e90-8fab-e9dac737bd17","year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:04.559268Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:ab6bba91970e873bfeb95982772f540aa07dee73cff40f683c32c52ec8e63feb","observation_id":"c58d2bf2-5ac0-4aac-9135-1e7583da58b1","resolution":{"observed_at":"2026-08-06T20:47:11.373646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:10.871835Z","title":"How does GPT -2 compute greater-than?: Interpreting mathematical abilities in a pre-trained language model","venue":null,"work_id":"3e92a559-3851-4239-b94f-976eefaf7b54","year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:04.726134Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:81715a15c074b60070ab2f0c01a6c64a85716412842b5648f51120851f210434","observation_id":"219fdcb1-a9dc-46e2-894a-0bfa23f61067","resolution":{"observed_at":"2026-08-06T20:47:11.040573Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:10.502305Z","title":null,"venue":null,"work_id":"569d909a-4b9c-4ce9-9164-7cf3315584a6","year":2024},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:04.858328Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:2ad1118862cd66b5cfdc1135369f70ebd9b24f449dd6cec8e188ef206efd6d00","observation_id":"eacdb6e6-0dc5-4f5a-a378-24aacb8a8d4d","resolution":{"observed_at":"2026-08-06T20:47:10.677191Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-06T20:47:05.021127Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:05.021127Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:b1901403b3334a938068f9ad430f0594b9d25c889eec692f8b1e4b90a5b76e7d","observation_id":"5f5bd9f7-d638-4adb-a967-910e90828056","resolution":{"observed_at":"2026-08-06T20:47:05.021127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:05.200094Z","title":"Learning multiple layers of features from tiny images.(2009), 2009","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:05.200094Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:200772e57ab65a5dd2928a2db2f636aee7d79ee9950b4c1e4557a0c236f538db","observation_id":"9f6745f4-7f2e-40e3-9df7-942bb196b3cc","resolution":{"observed_at":"2026-08-06T20:47:05.200094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:10.294623Z","title":"Beyond the doors of perception: Vision transformers represent relations between objects","venue":null,"work_id":"19e84000-f8c4-4558-a6fd-f2ac072ac9c3","year":2024},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:05.331504Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:37cd3e03cb730a9b97069b76aa6b6dd8c52cdcf7f5601875451b850fc66d0704","observation_id":"948663c9-e9f1-4b37-8be8-10e5ca903714","resolution":{"observed_at":"2026-08-06T20:47:10.367160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:10.091885Z","title":"LL a VA -onevision: Easy visual task transfer","venue":null,"work_id":"0038a438-564a-4d4f-9e2e-152521a426cf","year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:05.533823Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:3369212e1b57664801bb4d3c7418da62bf80a228b8faf53d63bf9a78e28254e8","observation_id":"c6a79849-c175-4e02-a595-9753ee31a037","resolution":{"observed_at":"2026-08-06T20:47:10.174208Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:05.693814Z","title":"Inference-time intervention: Eliciting truthful answers from a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:05.693814Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:82b8d84c4c38b1d61cd711a63e6a271fdade4021a73dfa3e9add33720de6f3d3","observation_id":"a7aab324-ef49-4635-a7d8-1afb4b707de1","resolution":{"observed_at":"2026-08-06T20:47:05.693814Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18445","last_updated":"2025-04-10T08:56:52Z","snapshot_observed_at":"2026-08-07T16:41:59.861327Z","submitted_at":"2025-03-24T08:46:52Z","title":"Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness","version":3},"cited_work":{"arxiv_id":"2503.18445","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.18445","snapshot_observed_at":"2026-08-06T20:47:08.369398Z","title":"Benchmarking Multi-modal Semantic Segmentation under Sensor Failures: Missing and Noisy Modality Robustness","venue":"cs.CV","work_id":"b3c70871-6e92-481e-b005-ae1ef950286e","year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:05.868757Z"},"links":{"cited_paper":"/paper/2503.18445","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:26ad5dfc5ec66f159db3037239073a647cdfec1d9e3ace7c115f214cbd85d819","observation_id":"88497041-3c36-4e81-98c0-491e01213a2f","resolution":{"observed_at":"2026-08-06T20:47:08.457560Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:06.023717Z","title":"Improved baselines with visual instruction tuning, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.023717Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:aac68c68537358a8f8f6cd0ac715fd0749eaba6f0adcde1fdcd19dcfa777706e","observation_id":"1a037fbd-c560-40f1-aafa-e548c41e9a26","resolution":{"observed_at":"2026-08-06T20:47:06.023717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:06.133530Z","title":"The quest for the right mediator: A history, survey, and theoretical grounding of causal interpretability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.133530Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:f736c41a983452ed3fd2afaf5a55a0d3eae4215832a1c2e6f79ee7136c0b262e","observation_id":"49b6407e-6b08-4795-83df-bbc8955a76a8","resolution":{"observed_at":"2026-08-06T20:47:06.133530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:09.877028Z","title":"Towards interpreting visual information processing in vision-language models","venue":null,"work_id":"053b5b56-a3b6-4069-b6ab-35e7b946dc6b","year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.237627Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:51742da258fecda586883b5a5a2d5ccd1c31a6f9f51b4af98b9c5ba57c8ece99","observation_id":"835729aa-e31d-4519-90a5-7c51c4c1ff2d","resolution":{"observed_at":"2026-08-06T20:47:09.966918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:06.342412Z","title":"Same task, different circuits: Disentangling modality-specific mechanisms in vlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.342412Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:66220809ed9c55e0f450d2d43e611139b985cf2a489c5fdfba0bd23921b8e449","observation_id":"78824f13-9509-4b94-8d80-070aee0ff6c5","resolution":{"observed_at":"2026-08-06T20:47:06.342412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:09.702185Z","title":"Introducing operator","venue":null,"work_id":"cf2bd6c3-28b5-4cb2-9b4c-3131be6d5f9f","year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.444748Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:bb56c213acdc94dcde5cf61f2d8163fbf5dfec2819bad886080c5e8ea23cd0fd","observation_id":"4045827d-8ad6-4910-aef7-c948e23bd086","resolution":{"observed_at":"2026-08-06T20:47:09.786996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:47:06.548025Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.548025Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:d78b75d677b2c9d4c69d4f089671d11c79ff99f12f6c64eb34e01bbe6d2522e3","observation_id":"a68d5511-6e85-4683-8fb3-0e6847d566ba","resolution":{"observed_at":"2026-08-06T20:47:06.548025Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.11695","last_updated":"2025-08-20T09:43:41Z","snapshot_observed_at":"2026-08-07T16:01:59.754745Z","submitted_at":"2025-04-16T01:40:06Z","title":"Interpreting the linear structure of vision-language model embedding spaces","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.11695","snapshot_observed_at":"2026-08-06T20:47:06.627050Z","title":"Interpreting the linear structure of vision-language model embedding spaces","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.627050Z"},"links":{"cited_paper":"/paper/2504.11695","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:11a628d9d1bdf0fe2529f7488ad0c324c7c1b61e2ef282c334faed6badeb02ac","observation_id":"f206f484-5183-40d2-a623-9fcab1b725fd","resolution":{"observed_at":"2026-08-06T20:47:06.627050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:09.506364Z","title":"V -measure: A conditional entropy-based external cluster evaluation measure","venue":null,"work_id":"1764f744-af7f-4340-abe2-29f86d8205cc","year":2007},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.718852Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:40fee74f2f15409b474799e648e7dc52ac6a99f833f4d4c065c3be98ed611479","observation_id":"bd9f27a9-779d-4f5d-9fa9-6b5c4f9df9a6","resolution":{"observed_at":"2026-08-06T20:47:09.607422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:06.822297Z","title":"On the Adversarial Robustness of Multi-Modal Foundation Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.822297Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:f5bda9c2daa9e56d195df37830174a61de0c57c5ec43b190881656abb3a53aa8","observation_id":"490fa9ea-1e47-4873-b46e-c7600c1a4bab","resolution":{"observed_at":"2026-08-06T20:47:06.822297Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:09.325084Z","title":"What do you learn from context? probing for sentence structure in contextualized word representations","venue":null,"work_id":"bc82ced2-330a-4ba9-8f7f-dfa6b44e29e2","year":null},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:06.925496Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:8bd725ba63bdfab229f131c5d74589f75362f9918ccfa4e269f8bb67bc4c2e90","observation_id":"27494d1a-1258-4ee3-8986-4321e9c8df62","resolution":{"observed_at":"2026-08-06T20:47:09.418278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:09.152338Z","title":"Bert rediscovers the classical nlp pipeline","venue":null,"work_id":"347479a0-4e40-4c55-986e-9c9e489d2e56","year":2019},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.030149Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:a6abefa32e73ad3e726490cbdb792b53ef6082f177b537e5798c40e3397da5d2","observation_id":"13cb4d14-85a6-4c25-978d-617ffba7998b","resolution":{"observed_at":"2026-08-06T20:47:09.236606Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:07.129570Z","title":"Investigating gender bias in language models using causal mediation analysis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.129570Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:3606acfde72c00802f00f120b10ae0f33c4f847db75a6734bc682a2fb41a5f0f","observation_id":"355d1c63-4f5c-4747-8764-fd6dccae3cb5","resolution":{"observed_at":"2026-08-06T20:47:07.129570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:07.202331Z","title":"Analyzing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.202331Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:890ae062b9f64fed48fadeed5c02579e313eb0766f0c9bceaa55eb07066b4d3c","observation_id":"2dec1286-d704-46a3-a389-0369d48bd845","resolution":{"observed_at":"2026-08-06T20:47:07.202331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:07.294072Z","title":"The caltech-ucsd birds-200-2011 dataset","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.294072Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:94effede4e7bf941e54622ccf44cc1b73abbea3664e9e3496d0efe55f60b86ad","observation_id":"7c22cf30-9bc8-4c25-b8de-56ac146da63a","resolution":{"observed_at":"2026-08-06T20:47:07.294072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-06T20:47:07.394735Z","title":"Interpretability in the wild: a circuit for indirect object identification in gpt-2 small","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.394735Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:1c2b7ce2be0bf0046f3a3f803de989207896efdb21da60b4bfe5695343c314a8","observation_id":"85216b34-3275-4f8e-8904-190d27a6f832","resolution":{"observed_at":"2026-08-06T20:47:07.394735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16033","last_updated":"2025-06-10T18:32:17Z","snapshot_observed_at":"2026-08-07T17:57:10.604846Z","submitted_at":"2025-02-22T01:52:37Z","title":"Multimodal Inconsistency Reasoning (MMIR): A New Benchmark for Multimodal Reasoning Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.16033","snapshot_observed_at":"2026-08-06T20:47:07.466049Z","title":"Multimodal inconsistency reasoning (mmir): A new benchmark for multimodal reasoning models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.466049Z"},"links":{"cited_paper":"/paper/2502.16033","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:4ab2324faa6818a6f03127e2e0f2c0b95a83f01b932a6b2cb8edddc597c79556","observation_id":"be17bcbc-6a94-4caf-9ef8-f2d0e315a1ea","resolution":{"observed_at":"2026-08-06T20:47:07.466049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:07.551656Z","title":"Characterizing mechanisms for factual recall in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.551656Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:fa27526f41d61f25f533da5901f1bf22f573fa64fb44e0d73346bbc67b29e870","observation_id":"cce0599b-a114-4793-bb89-cf434f2a65d5","resolution":{"observed_at":"2026-08-06T20:47:07.551656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:08.961895Z","title":"Does vision-and-language pretraining improve lexical grounding? In Findings of the Association for Computational Linguistics: EMNLP 2021, pages 4357--4366, 2021","venue":null,"work_id":"9d1f8052-6b84-4cb5-9cd4-d85cc3aafe0b","year":2021},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.648337Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:be2ab975693657258f975bc8abe061b7c342f094c8cfa7f1d728976405c209de","observation_id":"22a2a9d2-601a-437d-925d-a220b9229005","resolution":{"observed_at":"2026-08-06T20:47:09.052513Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:08.662443Z","title":"Emergence of abstract state representations in embodied sequence modeling","venue":null,"work_id":"a335dc6b-e482-4cbe-957e-42df27660e1c","year":2023},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.710731Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:f9c283277ebd2a264f48fa5cf0278ca019ffe8404a23a2f9a270b94659763350","observation_id":"1027564e-6fa4-4942-bd0d-549b07549037","resolution":{"observed_at":"2026-08-06T20:47:08.751769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:47:07.809459Z","title":"Calling a spade a heart: Gaslighting multimodal large language models via negation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.809459Z"},"links":{"citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:1b30ff1e492934f6e0d1f13a71c0b284a9ab5b192616e5be5c508040a341c3ae","observation_id":"658b2ef7-f1d6-4d56-b06a-25407e037b18","resolution":{"observed_at":"2026-08-06T20:47:07.809459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03659","last_updated":"2024-10-11T15:07:31Z","snapshot_observed_at":"2026-08-05T12:32:26.990966Z","submitted_at":"2024-10-04T17:59:28Z","title":"Unraveling Cross-Modality Knowledge Conflicts in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03659","snapshot_observed_at":"2026-08-06T20:47:07.903561Z","title":"Unraveling cross-modality knowledge conflict in large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:47:07.903561Z"},"links":{"cited_paper":"/paper/2410.03659","citing_paper":"/paper/2507.01790"},"observation_digest":"sha256:46dc9c4e0817d1432ca7d8bfe03bd25d630c0df79e24a6dc6d9d2f0c4d89fb1b","observation_id":"9c47deb8-34ed-426f-b729-1e8ce3c23b4d","resolution":{"observed_at":"2026-08-06T20:47:07.903561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.01790","last_updated":"2025-07-02T15:15:14Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T20:40:19.349439Z","submitted_at":"2025-07-02T15:15:14Z","title":"How Do Vision-Language Models Process Conflicting Information Across Modalities?"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 7 inbound Pith citation observations for arXiv:2507.01790."}