{"as_of":"2026-08-08T08:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fac378810d2924a739611022d5398e355530cab06c7f4968c06ed7bb059dda0e","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T15:32:34.571356Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.15652/citation-record","integrity":"/paper/2507.15652/integrity","json":"/paper/2507.15652/citation-record.json","paper":"/paper/2507.15652"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-06T15:32:34.328327Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.328327Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:9ac2ebf4ebf9620280a5abc2c2011e7142ba2edf792e5975dc5d0403abeba57d","observation_id":"2130b2a7-bad8-4f6e-87ed-024feb8423c5","resolution":{"observed_at":"2026-08-06T15:32:34.328327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-06T15:32:34.332331Z","title":"Minicpm-v: A gpt-4v level mllm on your phone,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.332331Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:3d88c4e521a9246a00c1f4000e896dc3f6267224bbac35200e1b37f00b6fe8d5","observation_id":"17c919b7-2fdc-491c-b2cc-9c284d6233e7","resolution":{"observed_at":"2026-08-06T15:32:34.332331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-06T15:32:34.441636Z","title":"Deepseek-vl: towards real-world vision-language understanding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.441636Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:abec9100a7056e967cda36dc4168d56e1ceb11a3b0faec04eec625d24fadbc5e","observation_id":"a0314bc4-10ea-407c-9e23-8526f66cd422","resolution":{"observed_at":"2026-08-06T15:32:34.441636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-07T22:11:30.869700Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-06T15:32:34.445684Z","title":"Chameleon: Mixed-modal early-fusion foundation models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.445684Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:91b215001faee023d0cc274320bc8c9bdb5fe3aff1b1dbdcfea19f56b68cb6f2","observation_id":"d560e042-2d66-46c3-9ac1-0b5f3b2520d9","resolution":{"observed_at":"2026-08-06T15:32:34.445684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T15:32:34.449497Z","title":"Gpt-4 technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.449497Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:fff9f80526dbc8c3b71d8effa096dc4378ee39517cfbf30d3b101445943e3605","observation_id":"fcf4d8bd-c3ec-4d25-8c61-ea90b40d5844","resolution":{"observed_at":"2026-08-06T15:32:34.449497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.063854Z","title":"Improved baselines with visual instruction tuning,","venue":null,"work_id":"87a904cd-dc66-41fd-b738-664d2d72a474","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.452527Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:a4a1664fb24ac43e11b3c1f0daf8d1afef2415e2149f73a00d2669f10a1cb83c","observation_id":"593148cc-a9ac-4956-8084-0a63a7873b55","resolution":{"observed_at":"2026-08-06T15:32:35.067278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-07-06T18:43:09.852565Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-08-06T15:32:34.455945Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.455945Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:63bebecb6ebbd4d2895591ab268518b416c12a51632bfa6c6873b2173482b20d","observation_id":"d9b48a2b-da9c-441b-806f-bbcc140f388d","resolution":{"observed_at":"2026-08-06T15:32:34.455945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.18930","snapshot_observed_at":"2026-08-06T15:32:34.459305Z","title":"Hallucination of multimodal large language models: A survey,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.459305Z"},"links":{"cited_paper":"/paper/2404.18930","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:04b1c2dc3a95c8ae5bb230088a1a2f9cca3a829bb742fe1d85dfb3eddc85d29d","observation_id":"277e86f3-a42b-477d-b914-a29cc941b790","resolution":{"observed_at":"2026-08-06T15:32:34.459305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-07-06T17:23:26.913214Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-06T15:32:34.463265Z","title":"A survey on hallucination in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.463265Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:772e878d1cb6193e210e7e9e14052727dc6e6ce69be42a6faa5f22e21f6f8199","observation_id":"782f701a-cbda-4b39-9432-d2fffed004b8","resolution":{"observed_at":"2026-08-06T15:32:34.463265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-06T15:32:34.466909Z","title":"Evaluating object hallucination in large vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.466909Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:0a4a3fd0be5d7521a94819f68b8d74388659026971d6101c471c5bdf07cff450","observation_id":"6b3533b2-517e-4638-adca-81adca8f7420","resolution":{"observed_at":"2026-08-06T15:32:34.466909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-06T15:32:34.470098Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.470098Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:603a1dae8ea2454929d72d0e0cb857712104f775e519000571fc6840aa9b3989","observation_id":"0c1bf0fe-28d4-4ef2-a113-4ddc74b94663","resolution":{"observed_at":"2026-08-06T15:32:34.470098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05922","last_updated":"2023-09-12T02:34:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-12T02:34:06Z","title":"A Survey of Hallucination in Large Foundation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05922","snapshot_observed_at":"2026-08-06T15:32:34.473083Z","title":"A survey of hallucination in large foundation models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.473083Z"},"links":{"cited_paper":"/paper/2309.05922","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:a274273630a4a4e0b7dc71f98a03014d828b0cb7580866f0ab3b4f19c6b4f4bb","observation_id":"6a2627c0-c68d-4aff-87a2-6975aa66c9b1","resolution":{"observed_at":"2026-08-06T15:32:34.473083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-06T18:57:51.817317Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-06T15:32:34.476129Z","title":"Huatuogpt-vision, towards injecting medical visual knowledge into multimodal llms at scale,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.476129Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:57adef258a6dd4bd8d532466fdfe4b26efcfab2318bf819e3913d827c008c473","observation_id":"4180b87b-fc99-4342-8b17-1fff9bf367cf","resolution":{"observed_at":"2026-08-06T15:32:34.476129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.04920","last_updated":"2023-04-11T01:17:11Z","snapshot_observed_at":"2026-07-06T15:14:13.670044Z","submitted_at":"2023-04-11T01:17:11Z","title":"Advancing Medical Imaging with Language Models: A Journey from N-grams to ChatGPT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.04920","snapshot_observed_at":"2026-08-06T15:32:34.479419Z","title":"Advancing medical imaging with language models: A journey from n-grams to chatgpt,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.479419Z"},"links":{"cited_paper":"/paper/2304.04920","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:7d469a0691f7e90d99afc1ab15bc776c6727a8a54e69c3254f917c7549447bd7","observation_id":"67f260e9-e7ee-46aa-a772-65389cf85913","resolution":{"observed_at":"2026-08-06T15:32:34.479419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.07257","last_updated":"2023-02-14T18:54:06Z","snapshot_observed_at":"2026-08-03T20:37:02.517912Z","submitted_at":"2023-02-14T18:54:06Z","title":"ChatCAD: Interactive Computer-Aided Diagnosis on Medical Image using Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.07257","snapshot_observed_at":"2026-08-06T15:32:34.483196Z","title":"Chatcad: Interactive computer-aided diagnosis on medical image using large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.483196Z"},"links":{"cited_paper":"/paper/2302.07257","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:6aaad0ef0b150156b2c0750c7a3d9f2f9caad1812907ff2621345b06cee62a89","observation_id":"c0ece340-1017-479e-b169-fb1deadea48f","resolution":{"observed_at":"2026-08-06T15:32:34.483196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.053574Z","title":"A survey on multimodal large language models for autonomous driving,","venue":null,"work_id":"d9966f57-999c-4787-a598-11fff84c63ea","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.486759Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:b97186ee990eda9d3f0129fccfeeac6738c8852ceef852d389b4170f1147dc0b","observation_id":"e8257ff2-a84e-465c-81a6-ac3e9c0bef4c","resolution":{"observed_at":"2026-08-06T15:32:35.056723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:34.490330Z","title":"Drivemlm: Aligning multi-modal large language models with behavioral planning states for autonomous driving,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.490330Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:ded5082be534510e2cdf18a7ea7682b1dc44d97b85639d353ec70aaf5d33aaaf","observation_id":"348d23ca-efb2-4462-a8be-a161e57965cc","resolution":{"observed_at":"2026-08-06T15:32:34.490330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.043125Z","title":"Evaluating a large language model on searching for gui layouts,","venue":null,"work_id":"18343ef9-ac33-4259-8115-eb90ee002d07","year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.493938Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:a31e7b8654357da43d096a38fa619c85eac4a777fce0166e8f4825af1f8a6dfd","observation_id":"e82b4d40-579c-4b8a-ac39-81300039953e","resolution":{"observed_at":"2026-08-06T15:32:35.046906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-08-06T15:32:34.496883Z","title":"Dola: Decoding by contrasting layers improves factuality in large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.496883Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:f94e1d4e3d4853283407eb59b60ee77030765b73f26da1b3c6878b84578045be","observation_id":"d0c1b8c4-852a-40da-9bdd-f068354066ca","resolution":{"observed_at":"2026-08-06T15:32:34.496883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01548","last_updated":"2024-03-12T09:49:28Z","snapshot_observed_at":"2026-07-06T17:38:51.653737Z","submitted_at":"2024-03-03T15:53:41Z","title":"In-Context Sharpness as Alerts: An Inner Representation Perspective for Hallucination Mitigation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01548","snapshot_observed_at":"2026-08-06T15:32:34.499975Z","title":"In-context sharpness as alerts: An inner representation perspective for hallucination mitigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.499975Z"},"links":{"cited_paper":"/paper/2403.01548","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:8f33705a9afc164ce82b172c66bc202abef26c93be1408d9baad8c6c302100c4","observation_id":"d5142ab2-76c8-4829-b805-da10cfb555fe","resolution":{"observed_at":"2026-08-06T15:32:34.499975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02707","last_updated":"2025-05-18T11:18:56Z","snapshot_observed_at":"2026-08-04T21:25:41.967552Z","submitted_at":"2024-10-03T17:31:31Z","title":"LLMs Know More Than They Show: On the Intrinsic Representation of LLM Hallucinations","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02707","snapshot_observed_at":"2026-08-06T15:32:34.503372Z","title":"Llms know more than they show: On the intrinsic representation of llm hallucinations,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.503372Z"},"links":{"cited_paper":"/paper/2410.02707","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:69a2c38ed54d308348417a3aeae3d3273b745f256c51d34f8bd35cb46fcb61ed","observation_id":"cabb3c46-a82a-4a36-9996-9b49f7605afe","resolution":{"observed_at":"2026-08-06T15:32:34.503372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02330","last_updated":"2024-10-03T09:28:59Z","snapshot_observed_at":"2026-07-06T19:26:54.335667Z","submitted_at":"2024-10-03T09:28:59Z","title":"Llama SLayer 8B: Shallow Layers Hold the Key to Knowledge Injection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02330","snapshot_observed_at":"2026-08-06T15:32:34.506797Z","title":"Llama slayer 8b: Shallow layers hold the key to knowledge injection,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.506797Z"},"links":{"cited_paper":"/paper/2410.02330","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:49fa074cca4555e5bcca7ff3520a09b707c89b8b9b59675d8332baaa5bd67e27","observation_id":"7c6b1805-2852-4866-9e1b-31ee16c1f0bf","resolution":{"observed_at":"2026-08-06T15:32:34.506797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14673","last_updated":"2024-10-04T22:14:09Z","snapshot_observed_at":"2026-08-06T16:47:41.787507Z","submitted_at":"2024-06-20T18:50:44Z","title":"Insights into LLM Long-Context Failures: When Transformers Know but Don't Tell","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14673","snapshot_observed_at":"2026-08-06T15:32:34.510625Z","title":"Insights into llm long-context failures: When transformers know but don’t tell,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.510625Z"},"links":{"cited_paper":"/paper/2406.14673","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:32d759d072cf48b8e3a4668bffb7c30a84b91cb47f79a3f0466c8a87cc6584e4","observation_id":"4684c0d9-e17a-4473-94a5-90294e5ce1e2","resolution":{"observed_at":"2026-08-06T15:32:34.510625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15017","last_updated":"2024-12-04T09:54:59Z","snapshot_observed_at":"2026-07-06T18:49:33.987133Z","submitted_at":"2024-07-22T06:15:59Z","title":"Knowledge Mechanisms in Large Language Models: A Survey and Perspective","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15017","snapshot_observed_at":"2026-08-06T15:32:34.514275Z","title":"Knowledge mechanisms in large language models: A survey and perspective,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.514275Z"},"links":{"cited_paper":"/paper/2407.15017","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:0ab52c48aeba4d1f0019737ca871aae1b00f9bf03e16a846909c550a427d1472","observation_id":"6ef8ed9b-9686-4ae0-af3d-8573f8159d15","resolution":{"observed_at":"2026-08-06T15:32:34.514275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-04T10:14:38.406056Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-06T15:32:34.517821Z","title":"Mllm can see? dynamic correction decoding for hallucination mitigation,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.517821Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:76157789086ac9bc8153f6928636af50f52e48f0a50d2bb1945198e8ed476060","observation_id":"3d1fcd93-d40d-4938-9cb3-0713876ef7b7","resolution":{"observed_at":"2026-08-06T15:32:34.517821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.032535Z","title":"Unleashing region understanding in intermediate layers for mllm-based referring expression generation,","venue":null,"work_id":"a838d037-45b1-43b5-84c2-fb54b8e74dc7","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.521189Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:4483ba1619fcb126c511bce417a1ff533825718369cc632062e19be48d9ef932","observation_id":"08b89adc-3f7e-4935-9b94-7cb210beee41","resolution":{"observed_at":"2026-08-06T15:32:35.036052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.022746Z","title":"Branchynet: Fast inference via early exiting from deep neural networks,","venue":null,"work_id":"6321b1b2-093f-492b-8f57-b4c8c8d13e75","year":2016},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.524262Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:faacd1e8823122ea17e7733d2d076ade9e549fc7629aac420091b4b473ed6c94","observation_id":"d6b394d2-9faa-4b38-a9e2-9b4122b41ac9","resolution":{"observed_at":"2026-08-06T15:32:35.026046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10073","last_updated":"2020-02-14T20:49:40Z","snapshot_observed_at":"2026-07-06T08:31:23.192830Z","submitted_at":"2019-10-22T16:15:58Z","title":"Depth-Adaptive Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.10073","snapshot_observed_at":"2026-08-06T15:32:34.526903Z","title":"Depth-adaptive transformer,","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.526903Z"},"links":{"cited_paper":"/paper/1910.10073","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:a3a9e4aed83f7a3adb69325d62806113cb8da789a928a26405a5083fdae83d16","observation_id":"1c694b9b-4ce1-4710-9d8f-3a0225167cdd","resolution":{"observed_at":"2026-08-06T15:32:34.526903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.013856Z","title":"Confident adaptive language modeling,","venue":null,"work_id":"610a489d-4eec-47ed-b380-1f0cc7c5e138","year":2022},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.529784Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:48e09090c9cef45e85d577b64ac011eff2fca724abcbb0364a4ed7987fccdf69","observation_id":"9e416501-821c-4235-b285-89d855e11dae","resolution":{"observed_at":"2026-08-06T15:32:35.016928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:35.002546Z","title":"Hallucination augmented contrastive learning for multimodal large language model,","venue":null,"work_id":"0ff703bc-270f-4e69-b3bf-c1b8da2a46e5","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.532510Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:6dc8988848aeda5659b9ea62a46e71b1c1508bfbd551605322d7ae9800186f3a","observation_id":"122b16fc-ee3d-4561-8175-2e63efa27f97","resolution":{"observed_at":"2026-08-06T15:32:35.007082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06775","last_updated":"2024-12-09T18:57:57Z","snapshot_observed_at":"2026-08-03T12:39:46.859532Z","submitted_at":"2024-12-09T18:57:57Z","title":"Delve into Visual Contrastive Decoding for Hallucination Mitigation of Large Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06775","snapshot_observed_at":"2026-08-06T15:32:34.535229Z","title":"Delve into visual contrastive decoding for hallucination mitigation of large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.535229Z"},"links":{"cited_paper":"/paper/2412.06775","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:9fd6387f3ce26b98a4f3f0e461655bad6bbe4ba247896844f679f6eb1da0a6c7","observation_id":"18cf72b5-94b0-4ae0-a7ec-10d30ecc1f81","resolution":{"observed_at":"2026-08-06T15:32:34.535229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:34.991254Z","title":"Mitigating object hallucina- tions in large vision-language models through visual contrastive decoding,","venue":null,"work_id":"1a490af6-904c-4e6a-b179-41be6c93ec1c","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.538089Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:55cb8e5db8d6025b461ba439c038f33ec054f2e58c4329e0aeb360acebcc9385","observation_id":"797cb5d4-3cbb-48dd-b67b-cfb374d74172","resolution":{"observed_at":"2026-08-06T15:32:34.995099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15269","last_updated":"2025-01-25T16:36:00Z","snapshot_observed_at":"2026-07-06T20:26:07.715114Z","submitted_at":"2025-01-25T16:36:00Z","title":"Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15269","snapshot_observed_at":"2026-08-06T15:32:34.540866Z","title":"Mirage in the eyes: Hallucination attack on multi-modal large language models with only attention sink,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.540866Z"},"links":{"cited_paper":"/paper/2501.15269","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:829d6ec4d32c5fd3e71568e6b8b0a74c43040c62b18aa93f74bf537ed539dfb2","observation_id":"d6d1e12e-8049-433f-a92f-0c05434cee76","resolution":{"observed_at":"2026-08-06T15:32:34.540866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:34.981650Z","title":"Hallucidoctor: Mitigating hallucinatory toxicity in visual instruction data,","venue":null,"work_id":"39b5257c-75e2-43bf-84c2-d0c5fa08f33b","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.544752Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:21b7082cd9fabffaaa70f4bcbd2c6a5e307581f197c137c31ef531becffafab5","observation_id":"95d0c6dc-2568-4125-b628-eef990370a11","resolution":{"observed_at":"2026-08-06T15:32:34.984548Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03577","last_updated":"2025-05-08T05:49:30Z","snapshot_observed_at":"2026-08-06T09:14:02.055269Z","submitted_at":"2024-10-04T16:30:54Z","title":"Look Twice Before You Answer: Memory-Space Visual Retracing for Hallucination Mitigation in Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03577","snapshot_observed_at":"2026-08-06T15:32:34.547689Z","title":"Look twice before you answer: Memory-space visual retracing for hallucination mitigation in multimodal large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.547689Z"},"links":{"cited_paper":"/paper/2410.03577","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:80e8c9090cc7ba89e5216e484badeac53c9cc60d95b8b02976049cbb6d451656","observation_id":"3fb021ba-c070-4165-94c6-e41693bede4e","resolution":{"observed_at":"2026-08-06T15:32:34.547689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20429","last_updated":"2024-09-30T15:52:05Z","snapshot_observed_at":"2026-07-06T19:24:39.402031Z","submitted_at":"2024-09-30T15:52:05Z","title":"HELPD: Mitigating Hallucination of LVLMs by Hierarchical Feedback Learning with Vision-enhanced Penalty Decoding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20429","snapshot_observed_at":"2026-08-06T15:32:34.551576Z","title":"Helpd: Mitigating hallucination of lvlms by hierarchical feedback learning with vision-enhanced penalty decoding,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.551576Z"},"links":{"cited_paper":"/paper/2409.20429","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:4876e6344a5d679a80974c6d79fc39b8f3cb8d27937b7ff672fff49b7301bbeb","observation_id":"5831311d-7ac5-4f57-a000-47a7816de68c","resolution":{"observed_at":"2026-08-06T15:32:34.551576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:34.971752Z","title":"Opera: Alleviating hallucination in multi-modal large language models via over-trust penalty and retrospection-allocation,","venue":null,"work_id":"1bf79497-8e46-4621-a58d-14894fbe203e","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.555323Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:2f8ff488a7c99ac510e1d6076d0eeb605e6b31771e77b8605f39c8538d389315","observation_id":"f4ff1d17-dd9f-4aeb-a2ab-d1ad4bcb5b74","resolution":{"observed_at":"2026-08-06T15:32:34.974822Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:34.961971Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning,","venue":null,"work_id":"637c6515-1d9a-44ad-8c9b-aef164e1b9eb","year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.558864Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:e30f6c209c8e39d48afdbbd891567b5ca34b8d570760b4fe8d497fc935ca0a72","observation_id":"73cd3b5b-2e83-4bba-ab18-0a85af58df7e","resolution":{"observed_at":"2026-08-06T15:32:34.965168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T15:32:34.949558Z","title":"MiniGPT-4: Enhancing vision-language understanding with advanced large language models,","venue":null,"work_id":"baa89aa6-3e55-44aa-a8dc-40ede82b033d","year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.561703Z"},"links":{"citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:09a60ce4e57bc5770c0ba0c73612ac0ddf808399721c0c4e24970e99fbe7e039","observation_id":"04aee0e3-03be-4a8f-95bc-bf62b28f4756","resolution":{"observed_at":"2026-08-06T15:32:34.954851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-06T15:32:34.564854Z","title":"Qwen technical report,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.564854Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:bf4692fc0b2460428ab8199d2b216c9024766e8809a0871611c1b6d47a200d2c","observation_id":"7bb93f49-e7d5-4f2c-946b-0155508fedfc","resolution":{"observed_at":"2026-08-06T15:32:34.564854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-07T09:14:56.498818Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15296","snapshot_observed_at":"2026-08-06T15:32:34.567976Z","title":"Mme-survey: A comprehensive survey on evaluation of multimodal llms,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.567976Z"},"links":{"cited_paper":"/paper/2411.15296","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:fbc99e0c48d3362c2ab3514eaf15370ff171777e9a84dfa35e886f7ca0197cf3","observation_id":"60c6ffac-10c6-440e-ac75-fe2fbdae59e4","resolution":{"observed_at":"2026-08-06T15:32:34.567976Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-04T05:57:07.163978Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-06T15:32:34.571356Z","title":"Object hallucination in image captioning,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T15:32:34.571356Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2507.15652"},"observation_digest":"sha256:8efc8201a874746904636cdfc8d7b749030d18dcfeae21f5a19b63861e88ad81","observation_id":"ec82dec8-964a-44bd-a05c-eef91f3066bf","resolution":{"observed_at":"2026-08-06T15:32:34.571356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.15652","last_updated":"2025-07-21T14:15:34Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T07:09:28.862790Z","submitted_at":"2025-07-21T14:15:34Z","title":"Extracting Visual Facts from Intermediate Layers for Mitigating Hallucinations in Multimodal Large Language Models"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":30,"verified_exact":0,"verified_fuzzy":12},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 0 inbound Pith citation observations for arXiv:2507.15652."}