{"as_of":"2026-08-10T17:36:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c200c3871c212108a9297be02e8fd721ca16b280871829579b5f299047b2bd0e","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T18:02:45.221151Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:14:36.819533Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00717","snapshot_observed_at":"2026-08-04T08:14:36.819533Z","title":"Mint: Mitigating hallucinations in large vision- language models via token reduction.arXiv preprint arXiv:2502.00717,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2510.22067","last_updated":"2026-05-29T17:43:25Z","snapshot_observed_at":"2026-08-06T06:21:50.480419Z","submitted_at":"2025-10-24T23:04:26Z","title":"Capturing Gaze Shifts for Guidance: Cross-Modal Fusion Enhancement for VLM Hallucination Mitigation","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T08:14:36.819533Z"},"links":{"cited_paper":"/paper/2502.00717","citing_paper":"/paper/2510.22067"},"observation_digest":"sha256:b1e38c9f13ee1710b6bcf8b9804c5abbac2de43fc309fcdcafcdfa03d7c680bc","observation_id":"fd86c048-156a-4a5a-8069-44b7abf78f3a","resolution":{"observed_at":"2026-08-04T08:14:36.819533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2502.00717/citation-record","integrity":"/paper/2502.00717/integrity","json":"/paper/2502.00717/citation-record.json","paper":"/paper/2502.00717"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-09T18:02:45.050009Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.050009Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:407c0edafbad19049aa4d7ec7f7be6fb88fba7e2c3d1342591e80d5f8a2947cb","observation_id":"3b22dc06-eb47-44c9-9f03-282b443d89b8","resolution":{"observed_at":"2026-08-09T18:02:45.050009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-09T18:02:45.055692Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.055692Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:d10ae1c8ae5edb08ec39b6cf1048d6b9b0a7c6ca1982b359f2e986bd7392eb03","observation_id":"343c750e-369e-41c8-9f7d-1aea43af12e6","resolution":{"observed_at":"2026-08-09T18:02:45.055692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.742798Z","title":"Y., Bhiwandiwalla, A., Tseng, S.-Y., Olson, M","venue":null,"work_id":"02807acd-22ef-403e-8d4d-86de16bd7d28","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.060876Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:3f20b260108a2b38d4da26261701d34c4b3e14c20ae8868872b7c6af3eda0a99","observation_id":"ab325d68-16af-4cea-b535-77d1c8190fff","resolution":{"observed_at":"2026-08-09T18:02:45.747062Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.067233Z","title":"Honeybee: Locality-enhanced projector for multimodal llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.067233Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:81ce25f0a7f4bd6a8a373c956b79f5d86882df16feba045b60daf4787e7c9f96","observation_id":"9559d8da-160f-4045-9d0a-02a68d05ef0e","resolution":{"observed_at":"2026-08-09T18:02:45.067233Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.718740Z","title":"Spatialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":"a2f0bf21-b472-405d-8af9-373037d4aa65","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.072247Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:bf683e01a7a9cb747fcbdd4ee062b1e2374541397f7ee8fb16118ef8d8a5f378","observation_id":"383ebc9f-4bf6-4de8-bc9d-85bb801cb0f0","resolution":{"observed_at":"2026-08-09T18:02:45.723271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.703527Z","title":"An image is worth 1/2 tokens after layer 2: Plug-and-play inference acceleration for large vision-language models","venue":null,"work_id":"1e973c4b-91b0-4bb6-a6f5-63acba213250","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.076964Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:9e05e72b850bdeafa97819b6c2abd9b171f2180f9b368303d3315b6a9ddaccbc","observation_id":"f88f5eed-8fc8-4fd3-bb2b-bb5685368e1b","resolution":{"observed_at":"2026-08-09T18:02:45.708557Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.082246Z","title":"E., Stoica, I., and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.082246Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:63c085538d14d48a85dac3e4cc8beda6138373ee1d42b8ee64933d731941f4a4","observation_id":"89cc4221-5b42-401d-86b6-b2dbb14f532e","resolution":{"observed_at":"2026-08-09T18:02:45.082246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.679864Z","title":"Vision transformers need registers","venue":null,"work_id":"4cfc6bee-f589-42f4-bcee-f8429eaa50d6","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.086650Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:c3622be9770fa5aa265413fd7fc0508bc0159d1aea6f8213fa2a209e8955074f","observation_id":"d6157353-10cd-43f9-86e8-79faf796d208","resolution":{"observed_at":"2026-08-09T18:02:45.684270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.665085Z","title":"Intern LM - XC omposer2-4 KHD : A pioneering large vision-language model handling resolutions from 336 pixels to 4k HD","venue":null,"work_id":"a6a06a61-56e6-4051-99a8-1a723fa48224","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.091136Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:e7c21381f290ad535bca1c69dab9dc01eb4f302c28779e6ad3d07e02f6cb8a11","observation_id":"5bf0cfb9-7f44-40ca-a3f1-b9f54ccac391","resolution":{"observed_at":"2026-08-09T18:02:45.670033Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-10T01:12:16.468283Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-09T18:02:45.095827Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.095827Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:ec14d11a0ce400adc9f8536d24fb36c522354f7bdaadfc3281bb8ce97a684184","observation_id":"e372e6e3-31ba-4f6a-865b-bc629db98ea6","resolution":{"observed_at":"2026-08-09T18:02:45.095827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-09T18:02:45.100605Z","title":"Mme: A comprehensive evaluation benchmark for multimodal large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.100605Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:6398e4836bc19dc3466770655a3c2e21d5b3104aac190c39174cfb66b2962ebf","observation_id":"2f08a5cf-e9aa-4df2-b351-654abf5b0a14","resolution":{"observed_at":"2026-08-09T18:02:45.100605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.646946Z","title":"A., Ma, W.-C., and Krishna, R","venue":null,"work_id":"c6be128e-3841-4503-a78b-8f5a74a8675d","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.105324Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:288f49ec275f81d7a0cc814c27fd34cf000a8d57a71fe1db578abf036a595f93","observation_id":"95cfe3cb-7e6d-4a2f-baa9-b6167e64caf6","resolution":{"observed_at":"2026-08-09T18:02:45.651387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.109865Z","title":"Detecting and preventing hallucinations in large vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.109865Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:8069b63b5eec373a2a363bc2366bdcd047523b33b11bcd636b96d5b80d383526","observation_id":"4ffa2056-e84d-400b-a949-dc8d7f4c3210","resolution":{"observed_at":"2026-08-09T18:02:45.109865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.114157Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.114157Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:9edbaec497a8afb06997ab46cfd23b02af1936eee1c1ae7fa2e39b4efff75340","observation_id":"3a2aeaed-9f09-4a0f-a3b5-70f50e8d4156","resolution":{"observed_at":"2026-08-09T18:02:45.114157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.118566Z","title":"Lisa: Reasoning segmentation via large language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.118566Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:28843641844e8205f6ba1147dd6c8a8d54563ebaa72876e38f16b49b549d2dcb","observation_id":"30b95d8e-1ec7-475b-afcf-3c95fb442e79","resolution":{"observed_at":"2026-08-09T18:02:45.118566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.122378Z","title":"Mitigating object hallucinations in large vision-language models through visual contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.122378Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:066976d4fc0d5ef5ccf37053306f7dada3ffe1b9d5cb71db61850ed6dd4926d6","observation_id":"349682b0-1ac4-443d-82db-dc44b05e0421","resolution":{"observed_at":"2026-08-09T18:02:45.122378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.594590Z","title":"L., Holtzman, A., Fried, D., Liang, P., Eisner, J., Hashimoto, T","venue":null,"work_id":"fcffd5ca-b917-4479-9f51-eb9f68d95aa8","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.126301Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:fffe71518a48c72a332a66ea3c67e0766c4ed24033165f39c60239442148019d","observation_id":"64779bfe-e615-4e27-a556-e84bd1fa8e30","resolution":{"observed_at":"2026-08-09T18:02:45.599498Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.579874Z","title":"X., and Wen, J.-R","venue":null,"work_id":"c26ef643-47ee-4a67-9198-0310a24318b2","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.130189Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:0f6862963400ff6f8e1c3572e7742d9c886175464a0c58c8496cac488489efb6","observation_id":"f62d742f-848e-496e-880e-a38e7393ee98","resolution":{"observed_at":"2026-08-09T18:02:45.584380Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.134091Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.134091Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:9d1950daedd6624d437b58fe0174bf2dbb5c05fb4683af039380f6ec3c921cb2","observation_id":"781cc07a-de18-4ce9-95aa-a5efcc45a1b3","resolution":{"observed_at":"2026-08-09T18:02:45.134091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.138911Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.138911Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:91afedd4977ce8681fdf0f40368f3510f9bb24ca9bb860ffb8504ac2ea0d82a9","observation_id":"5672227d-54e7-428c-8ba6-7beafcbbd65c","resolution":{"observed_at":"2026-08-09T18:02:45.138911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.142715Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.142715Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:6387b9e07bcd49174cd3be9bb490e4793c542ead1eec827961bd274b1a9eace2","observation_id":"571167a3-04f2-4dbf-9284-baab24b883aa","resolution":{"observed_at":"2026-08-09T18:02:45.142715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.146514Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.146514Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:9e3e4b56b9459cf9d2928bb17b997c10acc3afbfbc80bb14ffdf8e668bc12b74","observation_id":"97b06fc0-2d68-42f4-b18d-11fab6096eee","resolution":{"observed_at":"2026-08-09T18:02:45.146514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.150444Z","title":"Paying more attention to image: A training-free method for alleviating hallucination in lvlms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.150444Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:c0bc293610d9260843fbcfc6da18dee9b5e918586a138f97da5a1f65908fed79","observation_id":"0252356e-de8d-423d-9efc-932b5513b6eb","resolution":{"observed_at":"2026-08-09T18:02:45.150444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.154459Z","title":"W., Hallacy, C., Ramesh, A., Goh, G., Agarwal, S., Sastry, G., Askell, A., Mishkin, P., Clark, J., et al","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.154459Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:b3c636902de0c62e1403679f00cfe6582784f25081673fd82ccefba819947f56","observation_id":"08b1f8ac-079d-4cb0-9e07-ee0e7ba93298","resolution":{"observed_at":"2026-08-09T18:02:45.154459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.509646Z","title":"A., Burns, K., Darrell, T., and Saenko, K","venue":null,"work_id":"0c856928-7b3d-4f4c-af8c-3b712431bc3b","year":2018},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.158411Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:6bbe12d54a807c11b5c7eb3fc7860a231eaae1efb9838c7032704c0b64830f87","observation_id":"ebedfd82-17f5-42e2-aff5-020d954ec983","resolution":{"observed_at":"2026-08-09T18:02:45.514090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-09T18:02:45.162801Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.162801Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:01470ca1f41ba4db96addef82ab4330f7a96d0e1f96d7aad797f9f80cc223e08","observation_id":"ce2b2060-7f87-46b3-8445-9512446e5bbb","resolution":{"observed_at":"2026-08-09T18:02:45.162801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.18715","last_updated":"2024-06-05T13:53:42Z","snapshot_observed_at":"2026-08-10T16:33:51.164534Z","submitted_at":"2024-03-27T16:04:47Z","title":"Mitigating Hallucinations in Large Vision-Language Models with Instruction Contrastive Decoding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.18715","snapshot_observed_at":"2026-08-09T18:02:45.167476Z","title":"Mitigating hallucinations in large vision-language models with instruction contrastive decoding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.167476Z"},"links":{"cited_paper":"/paper/2403.18715","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:51d7562870bbd596ae3ca770bf8fcfe2f2003b3f993a0a49394a2a47c1bdd360","observation_id":"d0aff9bc-1a78-4a8b-825f-341e3ee67787","resolution":{"observed_at":"2026-08-09T18:02:45.167476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.495557Z","title":"Dilu: A knowledge-driven approach to autonomous driving with large language models","venue":null,"work_id":"d42a8328-3b12-47ff-8bfe-a5732d230568","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.172458Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:82675baf93e8d6db5722eebb1f4558611c7c2509ee5580465f1d29b07e5d55a5","observation_id":"6329c177-7233-409f-9149-ae22f4970fcc","resolution":{"observed_at":"2026-08-09T18:02:45.500108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.481415Z","title":"Q-instruct: Improving low-level visual abilities for multi-modality foundation models","venue":null,"work_id":"65434621-a422-43f4-a9a9-010482d89987","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.176770Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:aab85b57dd11b3aee8c2c27dd14485d9bb391310087dba0a02d5ea93df32c1fe","observation_id":"369c3dfa-6660-49a0-befb-f956d42bfe32","resolution":{"observed_at":"2026-08-09T18:02:45.485571Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.468973Z","title":"and Xie, S","venue":null,"work_id":"c262b1d0-7d93-49f2-9e9d-35a6664afdfc","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.180929Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:0d85f5571f80a14e1e196318b0183776fd645edd2e9a86fd03e8655fe673fcec","observation_id":"cf895cd9-62e4-4ca5-99a7-5fabac22c513","resolution":{"observed_at":"2026-08-09T18:02:45.472927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.454597Z","title":"D., and Potts, C","venue":null,"work_id":"39cb4406-973a-4984-863a-1b69aa56e187","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.185361Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:c93bc9e4e90145e83b28cef8b219ce691f18734937ba1ad5bd1103bc77b26647","observation_id":"e776ef32-e83d-4066-a204-ccbd657f4f72","resolution":{"observed_at":"2026-08-09T18:02:45.458914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.440361Z","title":"Efficient streaming language models with attention sinks","venue":null,"work_id":"04b00f0d-cf72-4ff0-9f6b-44f9d8eb0b3a","year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.189945Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:4891a95452222d5ff050d96a8ac4ac6c1c6b3eb0ee7695fd3a7d54f5747c03b8","observation_id":"e619e128-cb61-4748-b43d-8ae82552b336","resolution":{"observed_at":"2026-08-09T18:02:45.444862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.425861Z","title":"Multi-modal concept alignment pre-training for generative medical visual question answering","venue":null,"work_id":"ae0f76cf-66f5-412b-8a09-fcd7c08a3a05","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.194609Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:98afbad7b6f1b120fca8a0f47c170c5e3bee4d3583fec8b92b2cf61f0013a766","observation_id":"e9bbe534-fe4a-4a91-a9c7-17caf404e538","resolution":{"observed_at":"2026-08-09T18:02:45.430732Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20985","last_updated":"2024-05-31T16:31:38Z","snapshot_observed_at":"2026-08-04T13:01:39.904947Z","submitted_at":"2024-05-31T16:31:38Z","title":"DeCo: Decoupling Token Compression from Semantic Abstraction in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20985","snapshot_observed_at":"2026-08-09T18:02:45.199090Z","title":"Deco: Decoupling token compression from semantic abstraction in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.199090Z"},"links":{"cited_paper":"/paper/2405.20985","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:bb4446541cc313635c7d3c56602d522f529aeade83f330265b74163ad1766123","observation_id":"af8a30b9-e676-481c-b2c3-9729c9a16f13","resolution":{"observed_at":"2026-08-09T18:02:45.199090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.411487Z","title":"Attention prompting on image for large vision-language models","venue":null,"work_id":"e9d7ddec-cf7b-4024-a58a-aae1234f904e","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.203690Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:4a2d9d0aa4bd6da387b9f068362ea8319a1a976f0d30a841a12ded9dea7110ab","observation_id":"eca925e7-d6ec-4a08-a5f2-101acc3a8cdc","resolution":{"observed_at":"2026-08-09T18:02:45.416106Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.396508Z","title":"Rlhf-v: Towards trustworthy mllms via behavior alignment from fine-grained correctional human feedback","venue":null,"work_id":"e8f0a008-07b9-4970-8d6f-a3832911e3be","year":2024},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.208263Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:9de2709a7bcc0b5edc5e23e99c698514d8f8935eeee8bf2f15e7af3d28e143aa","observation_id":"682319d0-9100-471a-960d-3840f09aa90a","resolution":{"observed_at":"2026-08-09T18:02:45.401593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.379826Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":"818a06de-7dba-4072-b24b-f84d9a9b4592","year":2025},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.212469Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:b4c3deec11e3c54fd05b907f9c7266212945e6490c1ed553218343586ae0cba2","observation_id":"6eccde3b-c143-49ff-b44d-ab87ed1cf2ea","resolution":{"observed_at":"2026-08-09T18:02:45.386299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-09T18:02:45.216603Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.216603Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:34ae30af7cec048c9310c8a831c576a78f9e2249a679d1b89cc704f5934178fe","observation_id":"c8558b2e-e214-4e40-ba7c-19c2b880d798","resolution":{"observed_at":"2026-08-09T18:02:45.216603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T18:02:45.221151Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T18:02:45.221151Z"},"links":{"citing_paper":"/paper/2502.00717"},"observation_digest":"sha256:c694b36f7c5d06848910ee762158c298c4bda54bd48502c81a90824b5393d05d","observation_id":"5cc824b5-e1ea-4247-9981-92659d3c69a5","resolution":{"observed_at":"2026-08-09T18:02:45.221151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.00717","last_updated":"2025-02-02T08:34:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-10T16:34:08.630881Z","submitted_at":"2025-02-02T08:34:57Z","title":"MINT: Mitigating Hallucinations in Large Vision-Language Models via Token Reduction"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":18},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 1 inbound Pith citation observation for arXiv:2502.00717."}