Pith. sign in

Paper Citation Record · LEDGER

Cross-Modal Consistency in Multimodal Large Language Models

As of 13 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 4 inbound Pith citation observations for arXiv:2411.09273.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.09273 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T20:54:07.527927Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-13T06:32:02.005865+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T16:32:43.411887Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T09:17:48.857417Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact2
  • verified fuzzy0
  • unresolved22
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 49fb75d3-f0aa-4821-8dfe-33e148385ad4 · outbound

This paper cites Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond.

Cross-Modal Consistency in Multimodal Large Language Models Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.420201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.420201Z digest=sha256:7df1199b8ce5bf03aab1f1aa7fcde75cefca2a5d18f4985b6f6729b23baab003

Observation faa740de-faa2-4496-b262-29ae9ea5a219 · outbound

This paper cites MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs).

Cross-Modal Consistency in Multimodal Large Language Models MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.425517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.425517Z digest=sha256:6dd97ab834382ab55f27a95e9a12d450d464d3386e44394879ff864ba1626da1

Observation b3811fd5-be4e-43cc-a819-00870e45961f · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Cross-Modal Consistency in Multimodal Large Language Models Training Verifiers to Solve Math Word Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.430200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.430200Z digest=sha256:bb2973f8b5501914d7375be06c10e5e093b4890215ba253196dd0f8837603220

Observation 742b6e9c-60a9-47cd-8b58-1032967471b7 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Cross-Modal Consistency in Multimodal Large Language Models PaLM-E: An Embodied Multimodal Language Model

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.435149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.435149Z digest=sha256:135c1668691a7c6a518a5ee3eda1f30a784837baf029db85ba8588309a028225

Observation 5a1cc206-3f42-45bf-90ef-eed5b2167bfa · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Cross-Modal Consistency in Multimodal Large Language Models Measuring Massive Multitask Language Understanding

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.440685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.440685Z digest=sha256:6ebce45bc3981fa9d41f4f878f9fe4ff88ba2c44c911c78a1ad27d064270b8db

Observation 8e622d49-26e7-4857-ba10-f8cf0bd48ac5 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Cross-Modal Consistency in Multimodal Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.446103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.446103Z digest=sha256:5d6b89f9d3423e617dd7a48982e37f9306748d728c93a350790e4053ba1e0215

Observation ce548a52-605d-4522-a6f4-de712a00fa19 · outbound

This paper cites PromptCap: Prompt-Guided Task-Aware Image Captioning.

Cross-Modal Consistency in Multimodal Large Language Models PromptCap: Prompt-Guided Task-Aware Image Captioning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.451241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.451241Z digest=sha256:024eca0e1c5fcb1ae240e81229eb29d80ec20ed178ec65eb44f3c9f245238b88

Observation 173395fb-7368-4c4f-b63f-80dfdb7132cc · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-12T20:54:07.872469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.455776Z digest=sha256:3c82042d11bf8de89adbe09cb210d061fe08eb11743756f20eef26f918bbfd39

Observation 25788515-cd77-4579-a5e9-2a1afa0ef717 · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-12T20:54:07.858897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.460798Z digest=sha256:e7117ad7dc428da66d622a6d09d5facfa2de75489d7400355937451b8263aa19

Observation 708ae07d-8d11-44b7-bf6f-151d4b416632 · outbound

This paper cites REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering.

Cross-Modal Consistency in Multimodal Large Language Models REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-12T20:54:07.731682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.465522Z digest=sha256:0cde1ce1e85a29162c321806ba6fa3f1e2c30a1d2388ae9abcb162fa00f646e3

Observation 169630e9-0429-494f-9a41-dc87ed48384c · outbound

This paper cites MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning.

Cross-Modal Consistency in Multimodal Large Language Models MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.469910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.469910Z digest=sha256:d2346078ed18da2ff049f5ea86fd5324c2dafd7b3ff1ed861e25abd6e6484eb1

Observation e5630906-671a-4101-a529-86440425b3af · outbound

This paper cites LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning.

Cross-Modal Consistency in Multimodal Large Language Models LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.474475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.474475Z digest=sha256:2d92e1200a7d6920120d32a12ddddaf3258b4bab06cc4e15e27a3155fdb74f06

Observation dfad09cf-86c1-47c4-928a-d901d0ce2fb9 · outbound

This paper cites Holistic Evaluation of GPT-4V for Biomedical Imaging.

Cross-Modal Consistency in Multimodal Large Language Models Holistic Evaluation of GPT-4V for Biomedical Imaging

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.478765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.478765Z digest=sha256:6ea223a6b2790e23248d262902004d706dd6324dd1b0dfb5b958876fa14c4aa0

Observation 71c677c3-a823-455f-8497-157ebd9d8833 · outbound

This paper cites Learning Transferable Visual Models From Natural Language Supervision.

Cross-Modal Consistency in Multimodal Large Language Models Learning Transferable Visual Models From Natural Language Supervision

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.483516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.483516Z digest=sha256:2f7973e32406ae75351b43b39b41f6e42149035666d746f6458e24a2a5bd4c92

Observation 747fecb6-0335-46e2-92d3-675deca4df85 · outbound

This paper cites Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation.

Cross-Modal Consistency in Multimodal Large Language Models Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.487795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.487795Z digest=sha256:30a4fd76a748db50e3e4b9b4faabee452f6c751f06a7bd98a340082edec7ae5b

Observation 60417d2c-4c4c-42ff-aa95-11c697188820 · outbound

This paper cites On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving.

Cross-Modal Consistency in Multimodal Large Language Models On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.492582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.492582Z digest=sha256:b3e1e7fb770e7b97ca5f1e7bd42518496bee0fae2c516ae4107543201cc85203

Observation 8cbd03d4-cb4a-48de-bce0-0ff089a6e322 · outbound

This paper cites Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis.

Cross-Modal Consistency in Multimodal Large Language Models Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.496787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.496787Z digest=sha256:34282e5e315c3f061dfb193469f5f6d6d388b4636826864923c51174b1249167

Observation df4ba4a0-9376-4e86-b025-ed0616e0cbac · outbound

This paper cites The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision).

Cross-Modal Consistency in Multimodal Large Language Models The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.501393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.501393Z digest=sha256:c7ed8d0b5328c78eed0aefcc097a03df29d500ee8131a6f91a8fcf8b3ce4757b

Observation a7b99f50-89af-42a4-9dd8-568a1248705d · outbound

This paper cites TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models.

Cross-Modal Consistency in Multimodal Large Language Models TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.505703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.505703Z digest=sha256:2042da41e0849a03bfabca047c6baffe207207485908523e2841003913d09df8

Observation 9977f2fe-3ea0-4ba3-9174-c8bdabe0dd7a · outbound

This paper cites Vision-Language Models for Vision Tasks: A Survey.

Cross-Modal Consistency in Multimodal Large Language Models Vision-Language Models for Vision Tasks: A Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.510156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.510156Z digest=sha256:5523a85febcacd61c76abcac1235acd0c774d3600f5d6a0ba1de6544deb11158

Observation fb0be602-3bde-49bc-88ba-ab77ffafce5f · outbound

This paper cites Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs.

Cross-Modal Consistency in Multimodal Large Language Models Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.514494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.514494Z digest=sha256:fa278be6f545e5e617bfd958c29bb3ab5f423d788bb69076b0e0336d25f1c300

Observation f670afd0-93fd-426e-9b8b-5d241d8103cc · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 22

Resolution
verified exact
doi, observed 2026-08-12T20:54:07.561794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.519013Z digest=sha256:e90eb7cf547efc1b89474ec08e314037b1d268e7e1e0e49cc0982d3bf8b013e0

Observation 450f71d2-0fe0-41e9-b5f6-844c49a01c94 · outbound

This paper cites URL: " 'urlintro :=.

Cross-Modal Consistency in Multimodal Large Language Models URL: " 'urlintro :=

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.523015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.523015Z digest=sha256:a2eaaecb7ec8acadcbc1f726c73dc5d7b31df9b1c3a4c507a0f8e2eff9a42ecd

Observation 7aaf04ab-ca56-4471-9cce-da84e8458829 · outbound

This paper cites write newline.

Cross-Modal Consistency in Multimodal Large Language Models write newline

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.527927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.527927Z digest=sha256:de549d77854ca654332bfee2b2f09f155cc712d0a1aa59c0c83d81104304ad5b

Pith citing papers

Observation 40a8f85a-cfed-47dc-9d8f-be13d0e9ab5f · inbound

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models cites this paper.

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models Cross-Modal Consistency in Multimodal Large Language Models

Reference 111

Resolution
unresolved
no resolver link, observed 2026-08-05T16:32:43.411887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T16:32:43.411887Z digest=sha256:598f05b61b3f92e365d3ac3286fc863d492d3d7d0a241b4a037e972704d435bc

Observation 900018fe-9fc3-49c4-9679-768acc8fb38e · inbound

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models cites this paper.

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models Cross-Modal Consistency in Multimodal Large Language Models

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-18T05:45:56.141133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-05-18T05:45:07.700571Z digest=sha256:5cd789b06d1f8d8851bed6d93584b1b9ac870a3c840e414afe46b0f08f3e4f9a

Observation 584f76b2-ac1e-4b35-b8d5-37780522af70 · inbound

Information-Theoretic Decomposition for Multimodal Interaction Learning cites this paper.

Information-Theoretic Decomposition for Multimodal Interaction Learning Cross-Modal Consistency in Multimodal Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-03T09:17:48.859182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.

source=pdf_text observed=2026-06-27T10:25:02.384395Z digest=sha256:479c94be7442255487b6a684df64d8de330b588800bb4b8d4f237d29d6f0b950

Observation 0a8925eb-0edb-4761-9cb5-c604d27d11c5 · inbound

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs cites this paper.

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs Cross-Modal Consistency in Multimodal Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T00:55:26.897977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:55:26.897977Z digest=sha256:8fe8493cf141f8e2ef584a5154f920ad5ccdc82f6bddbbd3fe428fc14f3f73c8