{"as_of":"2026-08-15T20:29:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42891a20cd98fc563b8e1f58a33ca8092d8ae9df147a4cafbf65daaa492174b0","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:14:37.817377Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-15T06:32:42.880941+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2510.22067/citation-record","integrity":"/paper/2510.22067/integrity","json":"/paper/2510.22067/citation-record.json","paper":"/paper/2510.22067"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-04T08:14:35.768024Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:35.768024Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:75050dcd2135fac0de25d17641fd74d88cb415f7ac85fbc8dd24a378229ed850","observation_id":"9ae79580-080b-4527-abfb-919b202f836d","resolution":{"observed_at":"2026-08-04T08:14:35.768024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19280","last_updated":"2024-09-30T06:45:16Z","snapshot_observed_at":"2026-08-13T12:45:18.778190Z","submitted_at":"2024-06-27T15:50:41Z","title":"HuatuoGPT-Vision, Towards Injecting Medical Visual Knowledge into Multimodal LLMs at Scale","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19280","snapshot_observed_at":"2026-08-04T08:14:35.849953Z","title":"Huatuogpt-vision, towards injecting medi- cal visual knowledge into multimodal llms at scale.arXiv preprint arXiv:2406.19280, 2024b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:35.849953Z"},"links":{"cited_paper":"/paper/2406.19280","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:3c05253b1337e602b3be91f54ba70957cc5b177670d9877efcb3d92224512a61","observation_id":"d8977dd1-3c51-4d54-a3fc-f62988cf15b8","resolution":{"observed_at":"2026-08-04T08:14:35.849953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13949","last_updated":"2025-06-10T09:53:09Z","snapshot_observed_at":"2026-08-15T02:51:43.099783Z","submitted_at":"2024-12-18T15:29:30Z","title":"Cracking the Code of Hallucination in LVLMs with Vision-aware Head Divergence","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13949","snapshot_observed_at":"2026-08-04T08:14:36.018675Z","title":"Cracking the code of hallucination in lvlms with vision-aware head divergence.arXiv preprint arXiv:2412.13949,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.018675Z"},"links":{"cited_paper":"/paper/2412.13949","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:0b6f29341ce1c700a31e1e910b56428e7cdfb09c64d4db2f1656dcd1e25249da","observation_id":"44510d44-ff8f-4659-942a-4ce9cc822da4","resolution":{"observed_at":"2026-08-04T08:14:36.018675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-08-15T14:02:47.366139Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-04T08:14:36.169734Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.169734Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:c75ae960e22d0f9c4f79dc3986564750cb96c750c1e73c11539c37be5f6db53d","observation_id":"f9d43695-07d0-4e16-ba21-541b64c32ff8","resolution":{"observed_at":"2026-08-04T08:14:36.169734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.03321","last_updated":"2025-03-05T09:55:07Z","snapshot_observed_at":"2026-08-10T21:22:18.894347Z","submitted_at":"2025-03-05T09:55:07Z","title":"See What You Are Told: Visual Attention Sink in Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.03321","snapshot_observed_at":"2026-08-04T08:14:36.218482Z","title":"See what you are told: Visual attention sink in large multimodal models.arXiv preprint arXiv:2503.03321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.218482Z"},"links":{"cited_paper":"/paper/2503.03321","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:71f68e8c4eed4177ed444ea51bd466b8c86478694f4f27768508faf0830a2f99","observation_id":"863d9f65-ccbb-4e1e-9ae2-fd0b085c9787","resolution":{"observed_at":"2026-08-04T08:14:36.218482Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:14:36.259983Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale.In- ternational journal of computer vision, 128(7):1956–1981,","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.259983Z"},"links":{"citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:bf8c2bd80f3a558091d6aa4bd45f9ae0d8af8085e32a4c0906534e4e8ee12dd1","observation_id":"6cf07e3d-9b3d-4692-b185-ff93c934dce8","resolution":{"observed_at":"2026-08-04T08:14:36.259983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16125","last_updated":"2023-08-02T08:02:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-30T04:25:16Z","title":"SEED-Bench: Benchmarking Multimodal LLMs with Generative Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16125","snapshot_observed_at":"2026-08-04T08:14:36.303147Z","title":"Seed-bench: Bench- marking multimodal llms with generative comprehension.arXiv preprint arXiv:2307.16125, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.303147Z"},"links":{"cited_paper":"/paper/2307.16125","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:5576738f27c5de81b560dba4a67281900dd3287b137818e8d40366c2a0be2ce4","observation_id":"2238118a-95e6-4ae2-a752-ed872caccf5f","resolution":{"observed_at":"2026-08-04T08:14:36.303147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20095","last_updated":"2025-01-30T17:34:37Z","snapshot_observed_at":"2026-08-13T05:13:33.592096Z","submitted_at":"2024-06-28T17:59:12Z","title":"LLaRA: Supercharging Robot Learning Data for Vision-Language Policy","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20095","snapshot_observed_at":"2026-08-04T08:14:36.362519Z","title":"Blip-2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.362519Z"},"links":{"cited_paper":"/paper/2406.20095","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:46fa18053ebab8feebddd59a04091de1777b8ee85b5ee0f6f563b492c05d34d0","observation_id":"f7c9ead3-b030-400f-8aee-7eb155274e66","resolution":{"observed_at":"2026-08-04T08:14:36.362519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-08-12T18:48:30.326248Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-04T08:14:36.395839Z","title":"Evaluating object hallucination in large vision-language models.arXiv preprint arXiv:2305.10355, 2023d","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.395839Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:8f9023c199e1c0e412c0cb40db3b6100a5a7c5c182f5bd0cbff9052fb2004373","observation_id":"d2be8d0d-1efc-48f7-90dd-cdf54dd17cbd","resolution":{"observed_at":"2026-08-04T08:14:36.395839Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13321","last_updated":"2025-02-19T05:41:03Z","snapshot_observed_at":"2026-08-12T22:21:11.992738Z","submitted_at":"2024-10-17T08:24:27Z","title":"Mitigating Hallucinations in Large Vision-Language Models via Summary-Guided Decoding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13321","snapshot_observed_at":"2026-08-04T08:14:36.541664Z","title":"Mitigating hallucinations in large vision-language models via summary-guided decoding.arXiv preprint arXiv:2410.13321,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.541664Z"},"links":{"cited_paper":"/paper/2410.13321","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:6b1a237af37235546c89134b395d62779b0ea159edccda199083c4a49057a54a","observation_id":"8117fa5c-6801-4783-9d2a-43967664a79a","resolution":{"observed_at":"2026-08-04T08:14:36.541664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02156","last_updated":"2019-03-29T23:48:52Z","snapshot_observed_at":"2026-08-14T18:32:00.128699Z","submitted_at":"2018-09-06T18:25:18Z","title":"Object Hallucination in Image Captioning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02156","snapshot_observed_at":"2026-08-04T08:14:36.635360Z","title":"Anna Rohrbach, Lisa Anne Hendricks, Kaylee Burns, Trevor Darrell, and Kate Saenko","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.635360Z"},"links":{"cited_paper":"/paper/1809.02156","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:bca99599c1a9ea24455b53af87f11e5f5c5a2a4fac3e04aa9e09a0ae353dbc07","observation_id":"5ef232f3-ed38-462a-8175-99bae75ff279","resolution":{"observed_at":"2026-08-04T08:14:36.635360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.14525","last_updated":"2023-09-25T20:59:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-25T20:59:33Z","title":"Aligning Large Multimodal Models with Factually Augmented RLHF","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.14525","snapshot_observed_at":"2026-08-04T08:14:36.745595Z","title":"Aligning large multimodal models with factually augmented rlhf.arXiv preprint arXiv:2309.14525,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.745595Z"},"links":{"cited_paper":"/paper/2309.14525","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:edf44036cd0d41a4e1a88223160852d5a6d091bfe4d3589bef98e9f374fca521","observation_id":"6455772b-8bc2-4e39-a866-c54cd2bd2bd2","resolution":{"observed_at":"2026-08-04T08:14:36.745595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-15T15:18:31.195351Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00717","snapshot_observed_at":"2026-08-04T08:14:36.819533Z","title":"Mint: Mitigating hallucinations in large vision- language models via token reduction.arXiv preprint arXiv:2502.00717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.819533Z"},"links":{"cited_paper":"/paper/2502.00717","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:0271fa19931834b2e7fa7cddbd0a454dc0ea49826c74b13c816013781323d86e","observation_id":"fd86c048-156a-4a5a-8069-44b7abf78f3a","resolution":{"observed_at":"2026-08-04T08:14:36.819533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11779","last_updated":"2025-02-23T15:14:47Z","snapshot_observed_at":"2026-08-15T00:02:16.973993Z","submitted_at":"2024-10-15T16:57:44Z","title":"MLLM can see? Dynamic Correction Decoding for Hallucination Mitigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11779","snapshot_observed_at":"2026-08-04T08:14:36.931127Z","title":"Mllm can see? dynamic correction decoding for hallucination mitigation.arXiv preprint arXiv:2410.11779, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.931127Z"},"links":{"cited_paper":"/paper/2410.11779","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:d35a7b18ac8719310d93a4a3d5879e0277c1e1980e5a48ccebcbeb3dc933718a","observation_id":"6f147be7-e61c-4e8b-8103-9c192ac89fc8","resolution":{"observed_at":"2026-08-04T08:14:36.931127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-04T08:14:37.022240Z","title":"Efficient streaming language models with attention sinks, 2024.URL https://arxiv","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.022240Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:1fc2d2f8482eb5ae9720ebf4566d76cbb479f6f90ca60b8864f01018a98b01ec","observation_id":"1657e0f0-7d95-470a-bb6a-b6c83753092a","resolution":{"observed_at":"2026-08-04T08:14:37.022240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04099","last_updated":"2026-04-13T13:08:28Z","snapshot_observed_at":"2026-08-01T12:54:19.360091Z","submitted_at":"2025-04-05T07:57:11Z","title":"TARAC: Mitigating Hallucination in LVLMs via Temporal Attention Real-time Accumulative Connection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04099","snapshot_observed_at":"2026-08-04T08:14:37.107192Z","title":"Tarac: Mitigating hallucination in lvlms via temporal attention real-time accumulative connection.arXiv preprint arXiv:2504.04099,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.107192Z"},"links":{"cited_paper":"/paper/2504.04099","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:6d5fe5d2c6a6820f608034e5dc9f8c1c7011fd820f616966e129436440b8d3d3","observation_id":"0925bab1-209a-4a2e-baae-b823c54a58ab","resolution":{"observed_at":"2026-08-04T08:14:37.107192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-08-04T08:14:37.271830Z","title":"Mllms know where to look: Training-free perception of small visual details with multimodal llms.arXiv preprint arXiv:2502.17422,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.271830Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:d8e421dccfada2c96412e1144b1f4e5763af9db5f2fc73182304a52276f05116","observation_id":"71750f2c-0f0a-4adb-a554-14ff6c96b1d3","resolution":{"observed_at":"2026-08-04T08:14:37.271830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.02262","last_updated":"2024-10-01T04:10:34Z","snapshot_observed_at":"2026-08-13T05:33:06.228325Z","submitted_at":"2023-11-03T22:56:43Z","title":"Tell Your Model Where to Attend: Post-hoc Attention Steering for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.02262","snapshot_observed_at":"2026-08-04T08:14:37.418270Z","title":"Tell your model where to attend: Post-hoc attention steering for llms.arXiv preprint arXiv:2311.02262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.418270Z"},"links":{"cited_paper":"/paper/2311.02262","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:7665be21d30c352bc355d229a2f2f4fdb250ba58efc2a753e298d341a86e101a","observation_id":"2c38204a-6773-4a42-8f8f-36161a6ecb54","resolution":{"observed_at":"2026-08-04T08:14:37.418270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05262","last_updated":"2025-08-14T12:30:25Z","snapshot_observed_at":"2026-08-13T00:59:21.077559Z","submitted_at":"2024-03-08T12:35:07Z","title":"Debiasing Multimodal Large Language Models via Penalization of Language Priors","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05262","snapshot_observed_at":"2026-08-04T08:14:37.477584Z","title":"Debiasing multimodal large language models.arXiv preprint arXiv:2403.05262,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.477584Z"},"links":{"cited_paper":"/paper/2403.05262","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:5adf4e34526b142d52ce375d74e607be6606a75f30cc20c322f9eb481a61c5fe","observation_id":"62835c2e-a1ee-4832-8abc-d6737303a147","resolution":{"observed_at":"2026-08-04T08:14:37.477584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.14279","last_updated":"2026-05-28T06:50:29Z","snapshot_observed_at":"2026-08-12T15:18:35.540443Z","submitted_at":"2024-11-21T16:33:30Z","title":"Looking Beyond Text: Reducing Language bias in Large Vision-Language Models via Multimodal Dual-Attention and Soft-Image Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.14279","snapshot_observed_at":"2026-08-04T08:14:37.532330Z","title":"Looking beyond text: Reducing language bias in large vision-language models via multi- modal dual-attention and soft-image guidance.arXiv preprint arXiv:2411.14279,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.532330Z"},"links":{"cited_paper":"/paper/2411.14279","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:b8c48951be1d1ac4cd47b4c54cdba10e71461f8525a87538a15ffa65983ec835","observation_id":"25dd4e4e-ab37-4922-b807-c21f269f41e1","resolution":{"observed_at":"2026-08-04T08:14:37.532330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-04T08:14:37.580891Z","title":"Minigpt-4: En- hancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.580891Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:4e63788b37c325b93022f35f7d76ffd10eadfdbc759394c5dea875403d011a63","observation_id":"cc44c118-708b-4dd8-bf3a-ebcd0d0a57b6","resolution":{"observed_at":"2026-08-04T08:14:37.580891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:14:37.624957Z","title":"Is there a frisbee in the image?","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.624957Z"},"links":{"citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:9549270c4293dbb66a94a16ddb9b2e036a10d5ca14bdf4125ec36817a11c5b80","observation_id":"3d8c921f-02f7-49c7-b9f9-fbe8cb314f8b","resolution":{"observed_at":"2026-08-04T08:14:37.624957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:14:37.677470Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.677470Z"},"links":{"citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:3bffd69a942567e196eda1c4e58eb16cb8d242e8f4fcaa38217accfaf6f7938f","observation_id":"c95a9c96-069b-4f01-9bf5-c8eef3349d5f","resolution":{"observed_at":"2026-08-04T08:14:37.677470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:14:37.733137Z","title":"Please just answer yes or no","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.733137Z"},"links":{"citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:7e32061b9a3dd8de919a982cab2d760179acb6bfa9b81686297ec25d70c4b1ce","observation_id":"a1ff3dfc-3f15-446e-98d6-3eb5779162d9","resolution":{"observed_at":"2026-08-04T08:14:37.733137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:14:37.817377Z","title":"Layers for Cross-Modal Fusion Enhancement.Since the benchmarks we consider lack dedi- cated validation sets for hyperparameter tuning, we follow Kang et al","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:37.817377Z"},"links":{"citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:c9ac757bb5a998dea9f7c20e9bcaaeb1feeddf56a7f08578e2d3e147010c0a45","observation_id":"1010fef4-3055-45a3-9bd6-836145d28101","resolution":{"observed_at":"2026-08-04T08:14:37.817377Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-15T06:26:48.150151Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-08-04T08:14:36.452212Z","title":"Mitigat- ing hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":2014,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.452212Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:30f724323495b5e837bd1f0264fe09eb841c1e51a6107d1ecbb254fc7dd2014c","observation_id":"c248c1f3-1199-4590-9a48-c1ca94ec102e","resolution":{"observed_at":"2026-08-04T08:14:36.452212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02032","last_updated":"2025-03-16T06:51:13Z","snapshot_observed_at":"2026-08-14T10:17:31.703728Z","submitted_at":"2024-08-04T13:50:17Z","title":"Self-Introspective Decoding: Alleviating Hallucinations for Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02032","snapshot_observed_at":"2026-08-04T08:14:36.113235Z","title":"Self-introspective decoding: Alleviating hallucinations for large vision-language models.arXiv preprint arXiv:2408.02032,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.113235Z"},"links":{"cited_paper":"/paper/2408.02032","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:4c2eb7266191f9e347e458f77b128c1362c7a1923666adb64832bc770f3285ec","observation_id":"fec52c2c-783d-44ee-98a5-99ef68d68da4","resolution":{"observed_at":"2026-08-04T08:14:36.113235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T08:14:36.069949Z","title":"Drew A Hudson and Christopher D Manning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.069949Z"},"links":{"citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:552b345c2b78f310e9788b4b68a11582ffe64113f8a44ffe0cff8974d85fdd51","observation_id":"eb5943d7-59fd-4b9d-b3c0-40c2b3307e46","resolution":{"observed_at":"2026-08-04T08:14:36.069949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.00824","last_updated":"2024-04-16T23:32:38Z","snapshot_observed_at":"2026-08-14T15:23:27.194812Z","submitted_at":"2024-02-27T00:24:42Z","title":"Information Flow Routes: Automatically Interpreting Language Models at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.00824","snapshot_observed_at":"2026-08-04T08:14:35.922218Z","title":"Information flow routes: Automatically interpreting language models at scale.arXiv preprint arXiv:2403.00824,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:35.922218Z"},"links":{"cited_paper":"/paper/2403.00824","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:c734019ff7ef64d52edb6403dcb3000e9d5e99e88e74830a9f26f3d79f94eb7b","observation_id":"19dfcfd5-bdc8-44fd-a210-9d3f803fef97","resolution":{"observed_at":"2026-08-04T08:14:35.922218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-04T08:14:35.967483Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models.arXiv preprint arXiv:2306.13394,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:35.967483Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:c8f63259ca6cd5e76dbc30e0a6bdb086f08227df8fa21b37ecad823b7e3968ce","observation_id":"dc905e3d-6cc1-4f57-9794-b725bce5e1e8","resolution":{"observed_at":"2026-08-04T08:14:35.967483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06486","last_updated":"2025-03-09T07:07:03Z","snapshot_observed_at":"2026-08-15T02:23:54.540281Z","submitted_at":"2025-03-09T07:07:03Z","title":"PerturboLLaVA: Reducing Multimodal Hallucinations with Perturbative Visual Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06486","snapshot_observed_at":"2026-08-04T08:14:35.798130Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:35.798130Z"},"links":{"cited_paper":"/paper/2503.06486","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:297bac3a3935947b31427823af6ad305c12419e6e8d97e55c38d219878f0fbed","observation_id":"3183994d-7ed0-4758-b10b-f3d17259ae19","resolution":{"observed_at":"2026-08-04T08:14:35.798130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-15T06:32:42.880941+00:00","source":"crossref"},{"observed_at":"2026-08-15T06:32:39.529945+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2510.22067."}