{"as_of":"2026-08-18T07:45:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:492e77ab5fb6259ff41481ff56ecec7025c1c2b270ac42843f904c946d5f747b","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:56:59.651886Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-14T19:18:41.987533Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T19:19:23.960000Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"cited_work":{"arxiv_id":"2505.03420","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.03420","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating image captioning hallucinations in vision-language models","venue":null,"work_id":"f2a8d6b2-5252-4eb4-bfa9-37d7e1251755","year":2025},"citing_paper":{"arxiv_id":"2605.13156","last_updated":"2026-05-13T08:20:01Z","snapshot_observed_at":"2026-08-14T05:44:30.223847Z","submitted_at":"2026-05-13T08:20:01Z","title":"Dual-Pathway Circuits of Object Hallucination in Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-14T19:18:41.987533Z"},"links":{"cited_paper":"/paper/2505.03420","citing_paper":"/paper/2605.13156"},"observation_digest":"sha256:80c012bfed83fa27b2653c7db87ab173a2a731d122f333f50968fb236c40a935","observation_id":"1cc9f4ee-fb94-4a71-8c7b-05835ce49510","resolution":{"observed_at":"2026-05-14T19:19:23.965381Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.03420/citation-record","integrity":"/paper/2505.03420/integrity","json":"/paper/2505.03420/citation-record.json","paper":"/paper/2505.03420"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:57:00.032618Z","title":"Deep multimodal data fusion,","venue":null,"work_id":"a2495332-6444-4626-ae64-44dc49b55a7c","year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.531662Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:0ddb66a1f94921b3cf26015102f1e23f9902dd464a806f57420f64e993ed6e93","observation_id":"9192742d-3976-4fbe-ab73-e28885520b77","resolution":{"observed_at":"2026-08-15T23:57:00.038161Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00253","last_updated":"2024-05-06T01:10:01Z","snapshot_observed_at":"2026-08-17T09:37:14.144521Z","submitted_at":"2024-02-01T00:33:21Z","title":"A Survey on Hallucination in Large Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00253","snapshot_observed_at":"2026-08-15T23:56:59.536994Z","title":"A survey on hallucination in large vision-language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.536994Z"},"links":{"cited_paper":"/paper/2402.00253","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:c8048415adc50b0c19184992cef52bc74a9468b5386b04bfabb387edbd8a1e2b","observation_id":"d5aa29a2-3f2a-4b68-8404-8675e139e461","resolution":{"observed_at":"2026-08-15T23:56:59.536994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:57:00.016588Z","title":"Understanding and im- proving layer normalization,","venue":null,"work_id":"1a25b933-480e-40e4-a891-828e00565930","year":2019},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.541897Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:dac565588ef07803ddaa4cb12a3bb56ba2c43de93a1049d3c29fa369ddee611f","observation_id":"34d83191-f3c0-42d5-9360-26c34cb07cac","resolution":{"observed_at":"2026-08-15T23:57:00.021551Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:57:00.000492Z","title":"Miti- gating object hallucinations in large vision-language models through vi- sual contrastive decoding,","venue":null,"work_id":"ae0d007d-687a-49d7-9bfd-8fcdec37cfaa","year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.546613Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:d50b97250bed5e05e4f4dd923c2af78ce95ca1d2ff393b616204340f446c5178","observation_id":"9b92461d-49ae-4512-b422-22cb60193096","resolution":{"observed_at":"2026-08-15T23:57:00.005904Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.985228Z","title":"Chatgpt (mar 14 version),","venue":null,"work_id":"b02bbcfa-09aa-4255-af08-d5f3dbbc9d68","year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.551388Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:fc6e1bbad5dfa0c40b7aec390fe7daeb371ebac5168bbbdb7b7e60fa196c3a8a","observation_id":"6f444e48-278a-4ee3-8657-e0798669ec31","resolution":{"observed_at":"2026-08-15T23:56:59.990042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.969497Z","title":"Gemini (dec 1 version),","venue":null,"work_id":"4bb30f75-d3be-4b17-a354-1d9f6cea6d1e","year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.556196Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:ffaaa14538493500fbf37d3b3a5379dc3a864417aa9daacbf6cdeada2287d673","observation_id":"3e9917c7-ff18-47a3-9391-07295bf406ed","resolution":{"observed_at":"2026-08-15T23:56:59.974569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.561176Z","title":"Visual instruction tuning,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.561176Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:f35f2cf1258d89a49821f8ea3f4a5cc875632ce04f9644a27b1b4de582158e48","observation_id":"e31d3e08-dcf8-4f0d-8338-be19e0c43ba9","resolution":{"observed_at":"2026-08-15T23:56:59.561176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.16602","last_updated":"2023-12-27T14:54:37Z","snapshot_observed_at":"2026-08-16T14:31:22.976095Z","submitted_at":"2023-12-27T14:54:37Z","title":"Visual Instruction Tuning towards General-Purpose Multimodal Model: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.16602","snapshot_observed_at":"2026-08-15T23:56:59.565756Z","title":"Visual instruction tuning towards general-purpose multimodal model: A survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.565756Z"},"links":{"cited_paper":"/paper/2312.16602","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:15e63d3fec93ac38f0e3249e288e8c391afbd13363832f7caf8b91b18a435a17","observation_id":"29cbdcbe-db29-490d-80b9-d7b74546e00e","resolution":{"observed_at":"2026-08-15T23:56:59.565756Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.945058Z","title":"Checkguard: Advancing stolen check detection with a cross-modal image-text bench- mark dataset,","venue":null,"work_id":"6fff97fd-c851-4e8a-9a19-3dc5a3b02cff","year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.570836Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:95037ec98115b0dbe9719b3e4e30a54f9bc1270a645b8ffe7095a3c9c07c8188","observation_id":"eb8593ea-9e9f-4365-948c-56daf9349773","resolution":{"observed_at":"2026-08-15T23:56:59.949734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.575309Z","title":"Llava-next: Improved reasoning, ocr, and world knowledge,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.575309Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:7109bcf2266b0eb8b6003aa076b4d5b7b4d9657b577cdf025d9705dd231a5a37","observation_id":"3706723b-57a6-49dd-80e7-521b83e9937f","resolution":{"observed_at":"2026-08-15T23:56:59.575309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-15T23:56:59.580122Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.580122Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:fadc292818efda66ba6d1e4427e42e088dc91d5e078f124fdf658c0d40763007","observation_id":"7985b914-b4fc-415c-8710-8e6cbcf52fc6","resolution":{"observed_at":"2026-08-15T23:56:59.580122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02506","last_updated":"2024-01-18T22:09:40Z","snapshot_observed_at":"2026-08-16T15:50:47.043477Z","submitted_at":"2023-03-04T21:22:47Z","title":"Prismer: A Vision-Language Model with Multi-Task Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.02506","snapshot_observed_at":"2026-08-15T23:56:59.584659Z","title":"Prismer: A vision-language model with an ensemble of experts,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.584659Z"},"links":{"cited_paper":"/paper/2303.02506","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:09deedbf3784fb710a517c459fcf7cbb36ed95294b374684046ba474df736c72","observation_id":"c3f7cc08-52dd-4edc-b6af-5d73a12415d9","resolution":{"observed_at":"2026-08-15T23:56:59.584659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10185","last_updated":"2026-04-27T07:59:24Z","snapshot_observed_at":"2026-07-06T18:31:08.584682Z","submitted_at":"2024-06-14T17:14:22Z","title":"Detecting and Evaluating Medical Hallucinations in Large Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10185","snapshot_observed_at":"2026-08-15T23:56:59.589473Z","title":"Detecting and evaluating medical hallucinations in large vision language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.589473Z"},"links":{"cited_paper":"/paper/2406.10185","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:a59251b26118a72fa87f864b34428f224239553ccbf030fbe4de2792fb8104b3","observation_id":"db143b52-2a62-4b9e-9754-a5f7f58e7ccf","resolution":{"observed_at":"2026-08-15T23:56:59.589473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18010","last_updated":"2024-02-21T06:25:33Z","snapshot_observed_at":"2026-08-16T15:28:43.620260Z","submitted_at":"2023-05-29T11:03:59Z","title":"Test-Time Adaptation with CLIP Reward for Zero-Shot Generalization in Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18010","snapshot_observed_at":"2026-08-15T23:56:59.594270Z","title":"Test-time adaptation with clip reward for zero-shot generalization in vision-language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.594270Z"},"links":{"cited_paper":"/paper/2305.18010","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:c1b762667b9c9b1ba918c1fa83fbb3d2999fe0bd7e8f6dc2f60084fe93af5887","observation_id":"87f8fbe4-685e-4e72-9017-5a9c1cf87f6f","resolution":{"observed_at":"2026-08-15T23:56:59.594270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09734","last_updated":"2021-11-18T14:49:15Z","snapshot_observed_at":"2026-08-16T17:40:54.088104Z","submitted_at":"2021-11-18T14:49:15Z","title":"ClipCap: CLIP Prefix for Image Captioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09734","snapshot_observed_at":"2026-08-15T23:56:59.599232Z","title":"Clipcap: Clip prefix for image captioning,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.599232Z"},"links":{"cited_paper":"/paper/2111.09734","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:f5894f25a56fad596f6757d1f6d40c6aaab94b5203addbc45f0b1a73ba5cad42","observation_id":"41d52a2c-e9a5-4aab-8fd0-8d98ff9a5318","resolution":{"observed_at":"2026-08-15T23:56:59.599232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.919455Z","title":"Mitigating large vision- language model hallucination at post-hoc via multi-agent system,","venue":null,"work_id":"fe105206-c1a3-4bbb-a51c-3ca8ba4e419a","year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.604154Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:0ee1de63b27d02d9297ed8a64536fc7b3829e6eae25f3978a5f0b3a3080efc76","observation_id":"da6123eb-4ac2-42c4-ba18-76a4564b578f","resolution":{"observed_at":"2026-08-15T23:56:59.925103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14233","last_updated":"2025-01-06T13:58:45Z","snapshot_observed_at":"2026-08-16T13:58:51.888995Z","submitted_at":"2024-04-22T14:46:10Z","title":"Detecting and Mitigating Hallucination in Large Vision Language Models via Fine-Grained AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14233","snapshot_observed_at":"2026-08-15T23:56:59.608837Z","title":"Detecting and mitigating hallucination in large vision language models via fine-grained ai feedback,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.608837Z"},"links":{"cited_paper":"/paper/2404.14233","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:47c1ea657fe915103a6dd18752601da5e70380af4dfe6cf197560d1205d145b8","observation_id":"68806463-f33a-43b8-b587-9650d5077bad","resolution":{"observed_at":"2026-08-15T23:56:59.608837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08680","last_updated":"2025-06-11T21:33:21Z","snapshot_observed_at":"2026-08-16T14:18:52.863427Z","submitted_at":"2024-02-13T18:59:05Z","title":"Mitigating Object Hallucination in Large Vision-Language Models via Image-Grounded Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08680","snapshot_observed_at":"2026-08-15T23:56:59.613666Z","title":"Mitigating object hallucination in large vision-language models via classifier-free guidance,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.613666Z"},"links":{"cited_paper":"/paper/2402.08680","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:5344c5479da4a39941fee5924119aeb86e8afcf7669f20e681a2addcdab280d4","observation_id":"51cf1c56-bb8c-457e-bb1a-9ea54c16cfda","resolution":{"observed_at":"2026-08-15T23:56:59.613666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.903720Z","title":"Best-first beam search,","venue":null,"work_id":"f96358ff-2685-47a3-9031-5ace5b0ba91f","year":2020},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.618927Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:fc4eadf410b61c6c876e564d2c20f07f59969a9a0f28900b89da57a78308b6b7","observation_id":"aa4fce13-c512-4e9a-96e8-73f9169dcb6e","resolution":{"observed_at":"2026-08-15T23:56:59.908868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.623670Z","title":"Policy gradi- ent methods for reinforcement learning with function approximation,","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.623670Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:d2512e8643d7b3b3a07973d5dfc65789aa4a1c86a2372d45b16fc69a438c6076","observation_id":"0221d03e-0330-4ba7-8dd9-7e905a4a4143","resolution":{"observed_at":"2026-08-15T23:56:59.623670Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.628180Z","title":"Learning transferable visual models from natural language supervision,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.628180Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:033282d7685937523350e1e2576f82b4028927116b430ef240974e60ea36a5d8","observation_id":"9f5770c2-cda7-4918-aa57-c8586404d700","resolution":{"observed_at":"2026-08-15T23:56:59.628180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.632912Z","title":"Attention is all you need,","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.632912Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:35f2f539558c7504e7fffa44c6bacc81f4be93b2504dd5df1589c27075c5f9b3","observation_id":"c0673f22-919b-43f4-afcb-e33adbc8a4b1","resolution":{"observed_at":"2026-08-15T23:56:59.632912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.637425Z","title":"Facenet: A unified embed- ding for face recognition and clustering,","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.637425Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:494f66fefbbdd33abee7ee4e02a8be7148ca803d7bfa3694b6e786df3c9f6d67","observation_id":"001a194b-d610-423b-950a-c12364efba95","resolution":{"observed_at":"2026-08-15T23:56:59.637425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07397","last_updated":"2024-02-23T07:54:11Z","snapshot_observed_at":"2026-08-14T15:48:28.214119Z","submitted_at":"2023-11-13T15:25:42Z","title":"AMBER: An LLM-free Multi-dimensional Benchmark for MLLMs Hallucination Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07397","snapshot_observed_at":"2026-08-15T23:56:59.641620Z","title":"An llm-free multi-dimensional benchmark for mllms hallucination evaluation,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.641620Z"},"links":{"cited_paper":"/paper/2311.07397","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:e0e002e45fc9370d5135dc694659593b66a35f59fa526326c38e8ac63feace95","observation_id":"21735214-d299-4dc1-852b-bc675ad92b1a","resolution":{"observed_at":"2026-08-15T23:56:59.641620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.10328","last_updated":"2024-06-14T17:59:53Z","snapshot_observed_at":"2026-08-16T13:42:51.448762Z","submitted_at":"2024-06-14T17:59:53Z","title":"From Pixels to Prose: A Large Dataset of Dense Image Captions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.10328","snapshot_observed_at":"2026-08-15T23:56:59.647249Z","title":"From pixels to prose: A large dataset of dense image captions,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.647249Z"},"links":{"cited_paper":"/paper/2406.10328","citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:5b4122ab12acdb8be3b9ad3a9d1ef72d18342f7f3d086cb87e826671210baf20","observation_id":"2f25cb7e-3f8f-464e-8e3b-b500674241fd","resolution":{"observed_at":"2026-08-15T23:56:59.647249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:56:59.848246Z","title":"Llama 3.2 multimodal (version 2023),","venue":null,"work_id":"eb335057-7061-4a97-9ee4-f9eef11caaa8","year":2023},"citing_paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:56:59.651886Z"},"links":{"citing_paper":"/paper/2505.03420"},"observation_digest":"sha256:400b5b5dc832fb4391f455a6326427160b9332cbdacf78087b9fb9a0d473be3d","observation_id":"2b9f4120-1c75-4397-9b33-e92dd12e1989","resolution":{"observed_at":"2026-08-15T23:56:59.855141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.03420","last_updated":"2025-05-11T15:47:48Z","latest_version":2,"primary_category":"cs.MM","snapshot_observed_at":"2026-08-17T18:52:09.727694Z","submitted_at":"2025-05-06T10:55:21Z","title":"Mitigating Image Captioning Hallucinations in Vision-Language Models"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":17,"verified_exact":0,"verified_fuzzy":9},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 1 inbound Pith citation observation for arXiv:2505.03420."}