{"as_of":"2026-08-08T11:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:21ffeded71843bec658dd9f83ef1fca26afe9411559d6b867dae71f7a4c62f2c","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T21:15:25.010442Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T22:30:28.401425Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04163","snapshot_observed_at":"2026-07-14T12:50:33.254161Z","title":"Seeme: Mitigating hallucinations in large vision-language models through effective visual token engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.10296","last_updated":"2026-07-11T12:47:27Z","snapshot_observed_at":"2026-08-06T14:05:48.466865Z","submitted_at":"2026-07-11T12:47:27Z","title":"SPARK: Susceptibility-Guided Profiling and Steering of Latent Reasoning States in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T12:50:33.254161Z"},"links":{"cited_paper":"/paper/2607.04163","citing_paper":"/paper/2607.10296"},"observation_digest":"sha256:aec157c286c70e74600aa890afba6b15e833937bbaf876861d036bcb6230ab8d","observation_id":"4ac47558-83b9-4470-a5cc-20aa60767907","resolution":{"observed_at":"2026-07-14T12:50:33.254161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.04163","snapshot_observed_at":"2026-08-01T22:30:28.401425Z","title":"Seeme: Mitigating hallucinations in large vision-language models through effective visual token engineering, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.15736","last_updated":"2026-07-17T08:15:35Z","snapshot_observed_at":"2026-08-04T15:39:09.890128Z","submitted_at":"2026-07-17T08:15:35Z","title":"Better Starts, Better Ends: Bootstrapped Iterative Self-Reasoning Distillation for Compressed Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T22:30:28.401425Z"},"links":{"cited_paper":"/paper/2607.04163","citing_paper":"/paper/2607.15736"},"observation_digest":"sha256:400702cb0ff7e200f2fb25df30d6852a1db6acae3bab770def9ed2ca1b445e4e","observation_id":"38483ab5-3502-41d5-8e6b-e19e2bfebca4","resolution":{"observed_at":"2026-08-01T22:30:28.401425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.04163/citation-record","integrity":"/paper/2607.04163/integrity","json":"/paper/2607.04163/citation-record.json","paper":"/paper/2607.04163"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Qwen technical report.arXiv preprint arXiv:2309.16609,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:3923206633e00d6e3f575c827c40456a8acd6a1dec217ab8145228bab70242d7","observation_id":"4b7259a3-4a16-4092-b3d4-2f59411556bd","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09461","last_updated":"2023-03-01T19:45:11Z","snapshot_observed_at":"2026-07-06T14:06:56.291161Z","submitted_at":"2022-10-17T22:23:40Z","title":"Token Merging: Your ViT But Faster","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09461","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Token merging: Your vit but faster.arXiv preprint arXiv:2210.09461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2210.09461","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:a524fca5b183d3462b29a2efd8d9888d89a3b13f9b634e2fe79d78cad4ba4281","observation_id":"10e41f4b-2d86-4135-a636-d290c04d5718","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07772","last_updated":"2025-07-04T20:41:54Z","snapshot_observed_at":"2026-08-07T17:15:41.986323Z","submitted_at":"2025-03-10T18:53:39Z","title":"Hallucinatory Image Tokens: A Training-free EAZY Approach on Detecting and Mitigating Object Hallucinations in LVLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07772","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Q., Jia, J., Qin, W., Tang, R., and Pavlovic, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2503.07772","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:4dc564f47364a78b93f43b8572d0c7cd957286063a83fb5e7337be3c90b2d078","observation_id":"4eaef454-e64d-4848-b478-eb1ab57e35ef","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision- language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:32ebf9a963549a18e2343af7b0f2a7160e56782f8d10d4fecf9164d6c403f81b","observation_id":"d0b7326d-2383-42c9-9fb2-519686d2e957","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03883","last_updated":"2024-03-11T02:01:09Z","snapshot_observed_at":"2026-08-06T11:43:44.726916Z","submitted_at":"2023-09-07T17:45:31Z","title":"DoLa: Decoding by Contrasting Layers Improves Factuality in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03883","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Dola: Decoding by contrasting layers improves factuality in large language models.arXiv preprint arXiv:2309.03883,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2309.03883","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:cc3ff542faf1431f3196cf1187644340cac1171d142953733679beb53637491c","observation_id":"d907c1e1-c2ba-4734-8e1c-cbe88d796015","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Bert: Pre-training of deep bidirectional transformers for lan- guage understanding","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:59985f9a462195ab63fb435e9aa2436aaf142d65dad86e1362b8ff996ce77e50","observation_id":"c0f44307-c052-4974-9a52-f26a5dcc9a25","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Guan, T., Liu, F., Wu, X., Xian, R., Li, Z., Liu, X., Wang, X., Chen, L., Huang, F., Yacoob, Y ., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:4e513e5ddeb2525cb7b4c98107d18acc24bc64b143c611be3691217a269c1b02","observation_id":"02d8d75a-719c-4320-9cea-51f7ea77b814","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12359","last_updated":"2025-05-18T10:44:45Z","snapshot_observed_at":"2026-08-07T15:43:40.543812Z","submitted_at":"2025-05-18T10:44:45Z","title":"STAR: Stage-Wise Attention-Guided Token Reduction for Efficient Large Vision-Language Models Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12359","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Star: Stage-wise attention-guided token reduction for efficient large vision-language models inference.arXiv preprint arXiv:2505.12359,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2505.12359","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:3c38cf2e4fe7abfff48fafccfa540d0dc558c69bc07fc6e12eb9326f65095b8b","observation_id":"19c7353c-3bf3-4ee6-a47c-bd1674acfd41","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.29431","last_updated":"2026-07-07T03:19:40Z","snapshot_observed_at":"2026-08-02T13:30:27.757596Z","submitted_at":"2026-06-28T14:48:08Z","title":"FADE: Mitigating Hallucinations by Reducing Language-Prior Dominance in Large Vision-Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.29431","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Han, Y ., Nie, L., Yin, J., Wu, J., and Yan, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2606.29431","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:d3e646aa643a7703d2761c802e51d9de6ad0cffec4d7e88170dc137540493981","observation_id":"a008a3cb-2cf6-46fd-9ab4-74ec8ed2dc2b","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Instructblip: Towards general-purpose vision-language models with instruction tuning.arXiv preprint arXiv:2305.06500,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:fdce111cc17a597b70435ee05a88e071c4690f22d91acb0e81829fa11e643f97","observation_id":"44e06353-3e91-496d-b4e4-68ba6ab95e51","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"X., and Wen, J.-R","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:1a31fa8707b37e1417705012875a0da5393109ba2a9dd7e3eb8120f711d86d2c","observation_id":"560e52da-ad60-4c77-811e-890006c97e45","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:16af589ede7a6c8a47a0ed1978fd599101ba832cc18aff6544999f496cbc4801","observation_id":"0cad0e59-4ada-494f-a6f0-dbbbdfd61b08","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14565","last_updated":"2024-03-19T22:53:25Z","snapshot_observed_at":"2026-08-06T22:33:34.254048Z","submitted_at":"2023-06-26T10:26:33Z","title":"Mitigating Hallucination in Large Multi-Modal Models via Robust Instruction Tuning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14565","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Mitigating hallucination in large multi-modal models via robust instruction tuning.arXiv preprint arXiv:2306.14565, 2023a","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2306.14565","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:3e71b139346b62835d351bbeb52c0e836e8c733afc19ef0a20a123d36743f45e","observation_id":"2fccedcd-8608-4de3-b7d7-cca237206623","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14093","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"A survey on vision-language-action models for embodied ai.arXiv preprint arXiv:2405.14093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2405.14093","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:b5bf6eb1c2e45519c160487e123a1ced37ac2fe27cd5d8c8e380aad9911df17e","observation_id":"0378b2c9-4a19-40b0-82d5-41e3ae4afd07","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"A., and Kundu, S","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:70da783eb5e411f9a0c5ea2c32fe2e11fa298372b960a1b8f0e861dd231e3523","observation_id":"958f2fa3-56c7-466c-a839-649fd0ad9f5e","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"J., and Yan, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:5f736e2d72d718708e10e124d1e907aaf48e28dea9e3320e84c08b6b97ba7ec3","observation_id":"7bcb6fd0-3701-4cc2-a328-71e433d80097","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.12343","last_updated":"2026-06-27T08:01:07Z","snapshot_observed_at":"2026-08-07T15:43:41.563554Z","submitted_at":"2025-05-18T10:15:42Z","title":"Mitigating Hallucinations via Inter-Layer Consistency Aggregation in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.12343","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Touvron, H., Lavril, T., Izacard, G., Martinet, X., Lachaux, M.-A., Lacroix, T., Rozi`ere, B., Goyal, N., Hambro, E., Azhar, F., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2505.12343","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:f7658a00c225bcac887bb6255d8a3992490f86354d3464bacab1fcae854dc013","observation_id":"281d4bee-1cdd-495e-acc0-9192d1101549","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Amber: An llm-free multi-dimensional benchmark for mllms hallucination evaluation.arXiv preprint arXiv:2311.07397,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:a77786f444d73a125fb47b0ad5692eacc281d47ba5e6445f1added241a7490bf","observation_id":"61c767f6-271d-412d-a0af-c84cc599ffe5","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.17820","last_updated":"2025-05-31T02:41:34Z","snapshot_observed_at":"2026-08-08T02:36:07.552587Z","submitted_at":"2024-05-28T04:40:57Z","title":"Don't Miss the Forest for the Trees: Attentional Vision Calibration for Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.17820","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Don’t miss the forest for the trees: Attentional vision calibra- tion for large vision language models.arXiv preprint arXiv:2405.17820,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2405.17820","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:fdcca4e24b012b328e42ef5e619960090225bed706cf648bb2afa2947b2aa732","observation_id":"1a135e4f-65fb-4554-bc10-866a59161538","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.11817","last_updated":"2025-02-13T08:11:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-22T10:26:14Z","title":"Hallucination is Inevitable: An Innate Limitation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.11817","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Hallucination is inevitable: An innate limitation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2401.11817","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:c0cfad67fd4033602ddac1437e54d4b11041b3108541defc8b023280b18a578e","observation_id":"3dbee225-cf8d-46f4-b824-5c33a77ee4f7","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01469","last_updated":"2024-08-04T16:26:14Z","snapshot_observed_at":"2026-08-06T01:14:15.953789Z","submitted_at":"2023-10-02T17:01:56Z","title":"LLM Lies: Hallucinations are not Bugs, but Features as Adversarial Examples","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01469","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Llm lies: Hallucinations are not bugs, but features as adversarial examples.arXiv preprint arXiv:2310.01469,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2310.01469","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:a688cad83831ed48aeaf109507c3a5ba46e7942b1b35fadbfbc5c02e2ec00953","observation_id":"d222690d-2e51-4425-b6df-b17441f817d5","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Not all errors are created equal: Ascot addresses late-stage fragility in efficient llm reasoning.arXiv Prepr","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:9ef582c1ddf5a3f98f4148b77091d95039fbac677135fcd35349d3a8fd472237","observation_id":"1b35f242-db33-4035-8c48-f71bcdfba914","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Not all queries need deep thought: Coficot for adaptive coarse-to-fine stateful refinement","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:2cd37895a50da6f05fbfbcf9ca9d29d4d392089f900be82bd248cf02d6ca2670","observation_id":"c5c597f6-df0e-4cdf-af84-05820f8bfb73","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04417","last_updated":"2025-06-03T04:12:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-06T09:18:04Z","title":"SparseVLM: Visual Token Sparsification for Efficient Vision-Language Model Inference","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04417","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Sparsevlm: Visual token sparsification for effi- cient vision-language model inference.arXiv preprint arXiv:2410.04417,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2410.04417","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:793c16f871cd0082943a3233acfab322e6ee06dc4ca08477e6e325434dcb7860","observation_id":"18157f53-17f8-435c-8620-248a523d780a","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.06791","last_updated":"2023-12-06T11:06:06Z","snapshot_observed_at":"2026-07-06T16:46:13.977014Z","submitted_at":"2023-11-12T09:58:16Z","title":"InfMLLM: A Unified Framework for Visual-Language Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.06791","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Infmllm: A unified framework for visual-language tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2311.06791","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:dabd37d63eb3e08d94147fa501c059fe45a3ba583636433ccb2ba192f75c5058","observation_id":"f236b25a-a134-43b3-a47d-85bbc32c7c0a","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00754","last_updated":"2024-03-16T19:28:08Z","snapshot_observed_at":"2026-08-02T06:11:56.496482Z","submitted_at":"2023-10-01T18:10:53Z","title":"Analyzing and Mitigating Object Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00754","snapshot_observed_at":"2026-07-11T21:15:25.010442Z","title":"Analyzing and mitigating object hallucination in large vision-language models.arXiv preprint arXiv:2310.00754, 2023b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-11T21:15:25.010442Z"},"links":{"cited_paper":"/paper/2310.00754","citing_paper":"/paper/2607.04163"},"observation_digest":"sha256:a79958257d7d19828fdfdb5052b53708d5aa82ebdada929c3bce46c0cd0e6cda","observation_id":"2066eb10-ace4-4c3c-abf2-95c0f4d1aaf8","resolution":{"observed_at":"2026-07-11T21:15:25.010442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.04163","last_updated":"2026-07-05T08:07:51Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-03T03:39:28.000436Z","submitted_at":"2026-07-05T08:07:51Z","title":"SeeMe: Mitigating Hallucinations in Large Vision-Language Models through Effective Visual Token Engineering"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 2 inbound Pith citation observations for arXiv:2607.04163."}