{"as_of":"2026-08-21T04:57:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b7fe6a17bdc81141d7cd4d86d66f416d9b0636b045fb3eb65f06146a7a8b1766","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":6,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":6,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:10:23.063436Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T12:33:33.035396Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":"2312.02219","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ea1f1bbb-6277-4057-924d-fe07368ef44e","year":2023},"citing_paper":{"arxiv_id":"2404.18930","last_updated":"2025-04-01T18:36:08Z","snapshot_observed_at":"2026-08-06T19:08:14.800394Z","submitted_at":"2024-04-29T17:59:41Z","title":"Hallucination of Multimodal Large Language Models: A Survey","version":2},"reference_index":158,"source":"pdf_text","source_observed_at":"2026-05-11T12:33:32.631346Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2404.18930"},"observation_digest":"sha256:8fdaf7412e4036117f2222d0c4fd58eecb7ac52e597580398e635de01eeaed16","observation_id":"5719a4c0-2b08-419c-aa78-cc1eab742cb3","resolution":{"observed_at":"2026-05-11T12:33:33.046661Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-15T23:10:23.063436Z","title":"Villa, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.05318","last_updated":"2025-05-08T15:02:49Z","snapshot_observed_at":"2026-08-19T17:18:57.210259Z","submitted_at":"2025-05-08T15:02:49Z","title":"Mapping User Trust in Vision Language Models: Research Landscape, Challenges, and Prospects","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-15T23:10:23.063436Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2505.05318"},"observation_digest":"sha256:fbcc4ff9a8df66dbec1b580026434c7efa71dcadb86e168d18e4c50a5d274330","observation_id":"751b6ba8-c280-4357-b9ed-8cee9cb374ff","resolution":{"observed_at":"2026-08-15T23:10:23.063436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-07T11:39:46.564120Z","title":"Behind the magic, merlim: Multi-modal evaluation benchmark for large image-language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.01850","last_updated":"2026-06-05T03:03:30Z","snapshot_observed_at":"2026-08-16T05:40:16.288402Z","submitted_at":"2025-06-02T16:38:50Z","title":"MoDA: Modulation Adapter for Fine-Grained Visual Grounding in Instructional MLLMs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:39:46.564120Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2506.01850"},"observation_digest":"sha256:84d5c08e48287dd0b3ed235073011bf46f9a21f3fba7056160deaaea8b205d7a","observation_id":"4d07bc38-9034-4e72-8b4a-265125a337a1","resolution":{"observed_at":"2026-08-07T11:39:46.564120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-07T05:43:33.934149Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07184","last_updated":"2025-06-08T15:08:52Z","snapshot_observed_at":"2026-08-08T16:44:02.022482Z","submitted_at":"2025-06-08T15:08:52Z","title":"Mitigating Behavioral Hallucination in Multimodal Large Language Models for Sequential Images","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T05:43:33.934149Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2506.07184"},"observation_digest":"sha256:e3e803d72675f28d998845e0f6551943b4edc0950dd4325a65fa41900774070c","observation_id":"0933451b-f5f2-4c78-8abe-84314733f6a8","resolution":{"observed_at":"2026-08-07T05:43:33.934149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-07T04:07:33.839250Z","title":"Behind the magic, merlim: Multi-modal evaluation benchmark for large image-language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.11571","last_updated":"2025-07-18T08:23:14Z","snapshot_observed_at":"2026-08-19T09:43:05.217958Z","submitted_at":"2025-06-13T08:27:45Z","title":"VFaith: Do Large Multimodal Models Really Reason on Seen Images Rather than Previous Memories?","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:07:33.839250Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2506.11571"},"observation_digest":"sha256:a6a2acad046b03c4565e989a55ea39adc8b46e52511cb75defd89582d467013e","observation_id":"0c4133bd-d41a-42d7-8080-f873a69e81af","resolution":{"observed_at":"2026-08-07T04:07:33.839250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02219","snapshot_observed_at":"2026-08-03T23:35:18.920899Z","title":"Behind the magic, merlim: Multi-modal evaluation benchmark for large image-language models.arXiv preprint arXiv:2312.02219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.05017","last_updated":"2026-06-07T15:01:12Z","snapshot_observed_at":"2026-08-15T17:28:17.283670Z","submitted_at":"2025-11-07T06:39:54Z","title":"Towards Mitigating Hallucinations in Large Vision-Language Models by Refining Textual Embeddings","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T23:35:18.920899Z"},"links":{"cited_paper":"/paper/2312.02219","citing_paper":"/paper/2511.05017"},"observation_digest":"sha256:17df7314635f4cef0d37ca0d1a68c774c016c0c9dc8ad3b3c23f9648106a64dc","observation_id":"c1f68f37-682c-48da-bb34-d2e721074214","resolution":{"observed_at":"2026-08-03T23:35:18.920899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.02219/citation-record","integrity":"/paper/2312.02219/integrity","json":"/paper/2312.02219/citation-record.json","paper":"/paper/2312.02219"},"outbound":[],"paper":{"arxiv_id":"2312.02219","last_updated":"2025-05-30T11:40:41Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-20T03:00:49.082600Z","submitted_at":"2023-12-03T16:39:36Z","title":"Behind the Magic, MERLIM: Multi-modal Evaluation Benchmark for Large Image-Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 6 inbound Pith citation observations for arXiv:2312.02219."}