Pith. sign in

Paper Citation Record · LEDGER

Cross-Modal Consistency in Multimodal Large Language Models

As of 19 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 4 inbound Pith citation observations for arXiv:2411.09273.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2411.09273 v1

Coverage vector

measured 24 of 24 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-12T20:54:07.527927Z

measured 28 of 28 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-18T06:34:40.430872+00:00

measured 4 of 4 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links, observed 2026-08-05T16:32:43.411887Z

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: arxiv_reference, observed 2026-07-03T09:17:48.857417Z

Reference resolution

24 of 24 outbound references displayed

  • verified exact2
  • verified fuzzy0
  • unresolved22
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 49fb75d3-f0aa-4821-8dfe-33e148385ad4 · outbound

This paper cites Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond.

Cross-Modal Consistency in Multimodal Large Language Models Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.420201Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.420201Z digest=sha256:caf0f66a02ff60d16e246f1290e460fe773af7eb90e05a404f78063e1f3f1c82

Observation faa740de-faa2-4496-b262-29ae9ea5a219 · outbound

This paper cites MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs).

Cross-Modal Consistency in Multimodal Large Language Models MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.425517Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.425517Z digest=sha256:2e58a5a5c08c854e53d48770ad1e68b6e143a3b403472b00ed7460e52c3bb9ad

Observation b3811fd5-be4e-43cc-a819-00870e45961f · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

Cross-Modal Consistency in Multimodal Large Language Models Training Verifiers to Solve Math Word Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.430200Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.430200Z digest=sha256:b08c00fe0e91ea0b7d9fa399ed69fbfd935e9a2ab2cbb9ebdf6d0e88b698cf07

Observation 742b6e9c-60a9-47cd-8b58-1032967471b7 · outbound

This paper cites PaLM-E: An Embodied Multimodal Language Model.

Cross-Modal Consistency in Multimodal Large Language Models PaLM-E: An Embodied Multimodal Language Model

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.435149Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.435149Z digest=sha256:d3753494f5a878e60f411844256da3d710b7d586740859dd9664639a92e00cbf

Observation 5a1cc206-3f42-45bf-90ef-eed5b2167bfa · outbound

This paper cites Measuring Massive Multitask Language Understanding.

Cross-Modal Consistency in Multimodal Large Language Models Measuring Massive Multitask Language Understanding

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.440685Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.440685Z digest=sha256:0107315847a9127feb988ee87f12f214b423ea5957f3d75c2482931cd88b6ef7

Observation 8e622d49-26e7-4857-ba10-f8cf0bd48ac5 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

Cross-Modal Consistency in Multimodal Large Language Models Measuring Mathematical Problem Solving With the MATH Dataset

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.446103Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.446103Z digest=sha256:b7c7d55acc47afdd091ef452e09c1293053de8d940bd305e106e4e6d1fa98c43

Observation ce548a52-605d-4522-a6f4-de712a00fa19 · outbound

This paper cites PromptCap: Prompt-Guided Task-Aware Image Captioning.

Cross-Modal Consistency in Multimodal Large Language Models PromptCap: Prompt-Guided Task-Aware Image Captioning

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.451241Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.451241Z digest=sha256:551c08f6aff00675a5fcc1727f3f06fb49972d1a194cd224edd83b6b21e90b64

Observation 173395fb-7368-4c4f-b63f-80dfdb7132cc · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 8

Resolution
unresolved
raw_fallback, observed 2026-08-12T20:54:07.872469Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.455776Z digest=sha256:b1d94dac658d3df23318e86c7e794eb036c8834849b7344ddf13f2594b1afcac

Observation 25788515-cd77-4579-a5e9-2a1afa0ef717 · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 9

Resolution
unresolved
raw_fallback, observed 2026-08-12T20:54:07.858897Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.460798Z digest=sha256:78331479cfd6e879bf7b5541c4f3b62609a3eff43cf17c5935b3af6486d17409

Observation 708ae07d-8d11-44b7-bf6f-151d4b416632 · outbound

This paper cites REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering.

Cross-Modal Consistency in Multimodal Large Language Models REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-08-12T20:54:07.731682Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.465522Z digest=sha256:43b1a0df3b906e1ec153f74f132db05c635ac6888e4b0fce6315a07e72a25735

Observation 169630e9-0429-494f-9a41-dc87ed48384c · outbound

This paper cites MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning.

Cross-Modal Consistency in Multimodal Large Language Models MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.469910Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.469910Z digest=sha256:c59ac1ebb4c15c0ed5d94cc779fb1371eb9d141a46442e71cc6ba4b24271ce9d

Observation e5630906-671a-4101-a529-86440425b3af · outbound

This paper cites LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning.

Cross-Modal Consistency in Multimodal Large Language Models LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.474475Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.474475Z digest=sha256:72d137cda0c4a86f0715abbf21b63a9702fdf45bf0eb9f8af60227ab4cc6529f

Observation dfad09cf-86c1-47c4-928a-d901d0ce2fb9 · outbound

This paper cites Holistic Evaluation of GPT-4V for Biomedical Imaging.

Cross-Modal Consistency in Multimodal Large Language Models Holistic Evaluation of GPT-4V for Biomedical Imaging

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.478765Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.478765Z digest=sha256:246f117247ada8c796fc6075444f4c7a27ae82ea6a0f21b9a744b9c316b253b9

Observation 71c677c3-a823-455f-8497-157ebd9d8833 · outbound

This paper cites Learning Transferable Visual Models From Natural Language Supervision.

Cross-Modal Consistency in Multimodal Large Language Models Learning Transferable Visual Models From Natural Language Supervision

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.483516Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.483516Z digest=sha256:6d9959da0f209b71b1ef6267a7beef5c53cc4231187535dcff687760497dc73e

Observation 747fecb6-0335-46e2-92d3-675deca4df85 · outbound

This paper cites Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation.

Cross-Modal Consistency in Multimodal Large Language Models Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.487795Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.487795Z digest=sha256:c27e7966dac82bb35a6d8b14846d98832637023f63707c5c3bc76acb7ccfb514

Observation 60417d2c-4c4c-42ff-aa95-11c697188820 · outbound

This paper cites On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving.

Cross-Modal Consistency in Multimodal Large Language Models On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.492582Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.492582Z digest=sha256:fc0f149b93f0dcdaec058f963725a38d03b13a7092f25c8003fabab0118ba92a

Observation 8cbd03d4-cb4a-48de-bce0-0ff089a6e322 · outbound

This paper cites Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis.

Cross-Modal Consistency in Multimodal Large Language Models Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.496787Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.496787Z digest=sha256:75576b6168d04b5f707cbea7a50c62af455b7fe1e2a742624faeaa92d32af14b

Observation df4ba4a0-9376-4e86-b025-ed0616e0cbac · outbound

This paper cites The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision).

Cross-Modal Consistency in Multimodal Large Language Models The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.501393Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.501393Z digest=sha256:7f08672bee2dce35bd7f806f67861e18d602d1a04f39744cecf217cf940a0185

Observation a7b99f50-89af-42a4-9dd8-568a1248705d · outbound

This paper cites TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models.

Cross-Modal Consistency in Multimodal Large Language Models TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.505703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.505703Z digest=sha256:b84ac3cffb126ffd76c6974a5dbab3dc1981c7b87484de72b7b6b6765f786b5e

Observation 9977f2fe-3ea0-4ba3-9174-c8bdabe0dd7a · outbound

This paper cites Vision-Language Models for Vision Tasks: A Survey.

Cross-Modal Consistency in Multimodal Large Language Models Vision-Language Models for Vision Tasks: A Survey

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.510156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.510156Z digest=sha256:0eecacafdf325f43f9058699683092ae32cd4ba0c3decfef8c8b519a18706038

Observation fb0be602-3bde-49bc-88ba-ab77ffafce5f · outbound

This paper cites Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs.

Cross-Modal Consistency in Multimodal Large Language Models Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.514494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.514494Z digest=sha256:4eaea354a00dac42eeef019b1c9592ebddef852f759439be60a9195d36e6d225

Observation f670afd0-93fd-426e-9b8b-5d241d8103cc · outbound

This paper cites an unresolved cited work.

Cross-Modal Consistency in Multimodal Large Language Models Unresolved cited work

Reference 22

Resolution
verified exact
doi, observed 2026-08-12T20:54:07.561794Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=arxiv_source observed=2026-08-12T20:54:07.519013Z digest=sha256:f88cabf86490241e581f81c0778cd7dc0db0917647b835400ca6926ca51b7421

Observation 450f71d2-0fe0-41e9-b5f6-844c49a01c94 · outbound

This paper cites URL: " 'urlintro :=.

Cross-Modal Consistency in Multimodal Large Language Models URL: " 'urlintro :=

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.523015Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.523015Z digest=sha256:c6e52311ce68b43101a1bb5e12e04277763c156955592ba865fc85eba623c341

Observation 7aaf04ab-ca56-4471-9cce-da84e8458829 · outbound

This paper cites write newline.

Cross-Modal Consistency in Multimodal Large Language Models write newline

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-12T20:54:07.527927Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-12T20:54:07.527927Z digest=sha256:e411e872bfd723f30322da18951cd4532fbebbddfab24996e3dd67fce0ea89ec

Pith citing papers

Observation 40a8f85a-cfed-47dc-9d8f-be13d0e9ab5f · inbound

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models cites this paper.

SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models Cross-Modal Consistency in Multimodal Large Language Models

Reference 111

Resolution
unresolved
no resolver link, observed 2026-08-05T16:32:43.411887Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-05T16:32:43.411887Z digest=sha256:657ab3e9f1be7642c669ebcac5674a13c316c4a38189dcf73e668fb4c5f94435

Observation 900018fe-9fc3-49c4-9679-768acc8fb38e · inbound

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models cites this paper.

XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models Cross-Modal Consistency in Multimodal Large Language Models

Reference 25

Resolution
verified exact
arxiv_id, observed 2026-05-18T05:45:56.141133Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-05-18T05:45:07.700571Z digest=sha256:78a92de46f0c5ec1aba17adde6ba6d16e7dfe63009ea1c0734d0f7f984c52033

Observation 584f76b2-ac1e-4b35-b8d5-37780522af70 · inbound

Information-Theoretic Decomposition for Multimodal Interaction Learning cites this paper.

Information-Theoretic Decomposition for Multimodal Interaction Learning Cross-Modal Consistency in Multimodal Large Language Models

Reference 5

Resolution
verified exact
arxiv_id, observed 2026-07-03T09:17:48.859182Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.

source=pdf_text observed=2026-06-27T10:25:02.384395Z digest=sha256:218b510b363fd37cab3e6aaec319c171d1e49ba7066675aad2d2d11d74eabaa7

Observation 0a8925eb-0edb-4761-9cb5-c604d27d11c5 · inbound

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs cites this paper.

TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs Cross-Modal Consistency in Multimodal Large Language Models

Reference 48

Resolution
unresolved
no resolver link, observed 2026-08-03T00:55:26.897977Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-03T00:55:26.897977Z digest=sha256:3cecd49a8dafc962a2e0504f71c7b81a7fe08d0f4da1ef00fb7ae14275a9c401