{"as_of":"2026-08-12T15:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f92f27eaeed8fdd32816947e3cdf8a653562f64e08556a69077a5d04bd51f707","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":4,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":4,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T14:31:37.324356Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-12T12:02:33.629391Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2312.02896","last_updated":"2023-12-06T03:46:47Z","snapshot_observed_at":"2026-08-12T14:32:33.247066Z","submitted_at":"2023-12-05T17:06:59Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02896","snapshot_observed_at":"2026-08-12T14:31:37.324356Z","title":"Benchlmm: Benchmarking cross-style visual capability of large multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15296","last_updated":"2024-12-08T04:24:31Z","snapshot_observed_at":"2026-08-12T14:24:51.823396Z","submitted_at":"2024-11-22T18:59:54Z","title":"MME-Survey: A Comprehensive Survey on Evaluation of Multimodal LLMs","version":2},"reference_index":152,"source":"pdf_text","source_observed_at":"2026-08-12T14:31:37.324356Z"},"links":{"cited_paper":"/paper/2312.02896","citing_paper":"/paper/2411.15296"},"observation_digest":"sha256:a9108f9b6489dfa223585030650c2b2b728a9a46e1f685dcab4f3a037f433f75","observation_id":"49c8b065-42d5-487a-85fd-92b6f2a7c196","resolution":{"observed_at":"2026-08-12T14:31:37.324356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02896","last_updated":"2023-12-06T03:46:47Z","snapshot_observed_at":"2026-08-12T14:32:33.247066Z","submitted_at":"2023-12-05T17:06:59Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":"2312.02896","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.02896","snapshot_observed_at":"2026-08-12T12:02:33.629391Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","venue":"cs.CV","work_id":"8518ed1c-a15f-4df0-b58a-861a501e24d7","year":2023},"citing_paper":{"arxiv_id":"2411.17558","last_updated":"2024-11-26T16:21:03Z","snapshot_observed_at":"2026-08-12T11:56:56.099898Z","submitted_at":"2024-11-26T16:21:03Z","title":"Natural Language Understanding and Inference with MLLM in Visual Question Answering: A Survey","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T12:02:30.627193Z"},"links":{"cited_paper":"/paper/2312.02896","citing_paper":"/paper/2411.17558"},"observation_digest":"sha256:24511de161d2bb61ee636ec2cb7a80bf0dd97ddfd1d39fa75161cf0ebd44c7f0","observation_id":"165c3162-f5bf-405c-b537-2fd1dccf0b18","resolution":{"observed_at":"2026-08-12T12:02:33.634905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02896","last_updated":"2023-12-06T03:46:47Z","snapshot_observed_at":"2026-08-12T14:32:33.247066Z","submitted_at":"2023-12-05T17:06:59Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02896","snapshot_observed_at":"2026-08-11T23:54:23.666359Z","title":"Benchlmm: Benchmarking cross-style visual capability of large multimodal models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.02104","last_updated":"2024-12-03T02:54:31Z","snapshot_observed_at":"2026-08-12T00:49:07.041510Z","submitted_at":"2024-12-03T02:54:31Z","title":"Explainable and Interpretable Multimodal Large Language Models: A Comprehensive Survey","version":1},"reference_index":110,"source":"pdf_text","source_observed_at":"2026-08-11T23:54:23.666359Z"},"links":{"cited_paper":"/paper/2312.02896","citing_paper":"/paper/2412.02104"},"observation_digest":"sha256:c6db00f453a9f98602b0a2b8f6e9c8025718085ac8aae88e90836c41e156a2ab","observation_id":"8ed6cb96-8f46-42a8-8970-1ed3f11f8fcd","resolution":{"observed_at":"2026-08-11T23:54:23.666359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02896","last_updated":"2023-12-06T03:46:47Z","snapshot_observed_at":"2026-08-12T14:32:33.247066Z","submitted_at":"2023-12-05T17:06:59Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02896","snapshot_observed_at":"2026-08-11T14:59:01.270436Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18619","last_updated":"2024-12-30T03:00:30Z","snapshot_observed_at":"2026-08-11T19:52:22.380234Z","submitted_at":"2024-12-16T05:02:25Z","title":"Next Token Prediction Towards Multimodal Intelligence: A Comprehensive Survey","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-11T14:59:01.270436Z"},"links":{"cited_paper":"/paper/2312.02896","citing_paper":"/paper/2412.18619"},"observation_digest":"sha256:02af7235e928fbf437d74a2f63e251115b39e69dc3ceabd8da0b2016f6c8fa58","observation_id":"bf20845d-9085-4825-937d-cee5b6560c3c","resolution":{"observed_at":"2026-08-11T14:59:01.270436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2312.02896/citation-record","integrity":"/paper/2312.02896/integrity","json":"/paper/2312.02896/citation-record.json","paper":"/paper/2312.02896"},"outbound":[],"paper":{"arxiv_id":"2312.02896","last_updated":"2023-12-06T03:46:47Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-12T14:32:33.247066Z","submitted_at":"2023-12-05T17:06:59Z","title":"BenchLMM: Benchmarking Cross-style Visual Capability of Large Multimodal Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 4 inbound Pith citation observations for arXiv:2312.02896."}