{"as_of":"2026-08-14T02:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:becbb3e4e83e2bee349b2419eeb62c7d62e940d406b784e0763540fd1c9991e4","coverage":[{"denominator":24,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":24,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T20:54:07.527927Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:32:43.411887Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T09:17:48.857417Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-08-05T16:32:43.411887Z","title":"Cross-modal consistency in multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18179","last_updated":"2025-08-25T16:33:07Z","snapshot_observed_at":"2026-08-13T11:32:51.771701Z","submitted_at":"2025-08-25T16:33:07Z","title":"SEAM: Semantically Equivalent Across Modalities Benchmark for Vision-Language Models","version":1},"reference_index":111,"source":"arxiv_source","source_observed_at":"2026-08-05T16:32:43.411887Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2508.18179"},"observation_digest":"sha256:598f05b61b3f92e365d3ac3286fc863d492d3d7d0a241b4a037e972704d435bc","observation_id":"40a8f85a-cfed-47dc-9d8f-be13d0e9ab5f","resolution":{"observed_at":"2026-08-05T16:32:43.411887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.09273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-07-03T09:17:48.857417Z","title":"Cross-modal consistency in multimodal large language mod- els.arXiv preprint arXiv:2411.09273","venue":null,"work_id":"af50f76b-8a2f-4bdb-a155-cf7e44f7bda5","year":2024},"citing_paper":{"arxiv_id":"2510.15148","last_updated":"2026-04-04T21:55:10Z","snapshot_observed_at":"2026-08-11T19:00:42.610450Z","submitted_at":"2025-10-16T21:10:22Z","title":"XModBench: Benchmarking Cross-Modal Capabilities and Consistency in Omni-Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-18T05:45:07.700571Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2510.15148"},"observation_digest":"sha256:5cd789b06d1f8d8851bed6d93584b1b9ac870a3c840e414afe46b0f08f3e4f9a","observation_id":"900018fe-9fc3-49c4-9679-768acc8fb38e","resolution":{"observed_at":"2026-05-18T05:45:56.141133Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":"2411.09273","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-07-03T09:17:48.857417Z","title":"Cross-modal consistency in multimodal large language mod- els.arXiv preprint arXiv:2411.09273","venue":null,"work_id":"af50f76b-8a2f-4bdb-a155-cf7e44f7bda5","year":2024},"citing_paper":{"arxiv_id":"2606.11614","last_updated":"2026-06-10T03:27:13Z","snapshot_observed_at":"2026-08-12T17:35:28.374725Z","submitted_at":"2026-06-10T03:27:13Z","title":"Information-Theoretic Decomposition for Multimodal Interaction Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-27T10:25:02.384395Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2606.11614"},"observation_digest":"sha256:479c94be7442255487b6a684df64d8de330b588800bb4b8d4f237d29d6f0b950","observation_id":"584f76b2-ac1e-4b35-b8d5-37780522af70","resolution":{"observed_at":"2026-07-03T09:17:48.859182Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.09273","snapshot_observed_at":"2026-08-03T00:55:26.897977Z","title":"Cross-modal consistency in multimodal large language models.arXiv preprint arXiv:2411.09273, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.28640","last_updated":"2026-05-20T00:25:52Z","snapshot_observed_at":"2026-08-12T15:37:51.134557Z","submitted_at":"2026-05-20T00:25:52Z","title":"TokenSwap: Benchmarking and Reducing the Modality Gap in Multimodal LLMs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-03T00:55:26.897977Z"},"links":{"cited_paper":"/paper/2411.09273","citing_paper":"/paper/2607.28640"},"observation_digest":"sha256:8fe8493cf141f8e2ef584a5154f920ad5ccdc82f6bddbbd3fe428fc14f3f73c8","observation_id":"0a8925eb-0edb-4761-9cb5-c604d27d11c5","resolution":{"observed_at":"2026-08-03T00:55:26.897977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.09273/citation-record","integrity":"/paper/2411.09273/integrity","json":"/paper/2411.09273/citation-record.json","paper":"/paper/2411.09273"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.02071","last_updated":"2023-11-28T11:23:14Z","snapshot_observed_at":"2026-08-13T05:58:26.054876Z","submitted_at":"2023-10-03T14:13:36Z","title":"Towards End-to-End Embodied Decision Making via Multi-modal Large Language Model: Explorations with GPT4-Vision and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02071","snapshot_observed_at":"2026-08-12T20:54:07.420201Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.420201Z"},"links":{"cited_paper":"/paper/2310.02071","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:7df1199b8ce5bf03aab1f1aa7fcde75cefca2a5d18f4985b6f6729b23baab003","observation_id":"49fb75d3-f0aa-4821-8dfe-33e148385ad4","resolution":{"observed_at":"2026-08-12T20:54:07.420201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.04778","last_updated":"2025-06-27T17:08:56Z","snapshot_observed_at":"2026-08-12T22:29:28.114750Z","submitted_at":"2024-10-07T06:36:55Z","title":"MM-R$^3$: On (In-)Consistency of Vision-Language Models (VLMs)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.04778","snapshot_observed_at":"2026-08-12T20:54:07.425517Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.425517Z"},"links":{"cited_paper":"/paper/2410.04778","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:6dd97ab834382ab55f27a95e9a12d450d464d3386e44394879ff864ba1626da1","observation_id":"faa740de-faa2-4496-b262-29ae9ea5a219","resolution":{"observed_at":"2026-08-12T20:54:07.425517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T20:54:07.430200Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.430200Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:e0897d50be6af410d678f9833d2ba9723eaf632eb0fa2c87ae8cb2d734105121","observation_id":"b3811fd5-be4e-43cc-a819-00870e45961f","resolution":{"observed_at":"2026-08-12T20:54:07.430200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-08-14T01:53:48.691056Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-12T20:54:07.435149Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.435149Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:05019e81be2c9454656a5cc3de92ccf0aa657e5aa7c9da1fdeb7907d11a403d2","observation_id":"742b6e9c-60a9-47cd-8b58-1032967471b7","resolution":{"observed_at":"2026-08-12T20:54:07.435149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-12T20:54:07.440685Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.440685Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:82b143cd0562c8eff5e2be7b4591fe6d9fd0bf52908f586d1395b30d10bda6ed","observation_id":"5a1cc206-3f42-45bf-90ef-eed5b2167bfa","resolution":{"observed_at":"2026-08-12T20:54:07.440685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-12T20:54:07.446103Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.446103Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:5d6b89f9d3423e617dd7a48982e37f9306748d728c93a350790e4053ba1e0215","observation_id":"8e622d49-26e7-4857-ba10-f8cf0bd48ac5","resolution":{"observed_at":"2026-08-12T20:54:07.446103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09699","last_updated":"2023-08-17T21:43:24Z","snapshot_observed_at":"2026-08-13T17:05:26.904327Z","submitted_at":"2022-11-15T19:07:53Z","title":"PromptCap: Prompt-Guided Task-Aware Image Captioning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09699","snapshot_observed_at":"2026-08-12T20:54:07.451241Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.451241Z"},"links":{"cited_paper":"/paper/2211.09699","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:024eca0e1c5fcb1ae240e81229eb29d80ec20ed178ec65eb44f3c9f245238b88","observation_id":"ce548a52-605d-4522-a6f4-de712a00fa19","resolution":{"observed_at":"2026-08-12T20:54:07.451241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.868318Z","title":null,"venue":null,"work_id":"8cb50b1d-cce1-4c8e-bd8c-dd17dc063eac","year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.455776Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:3c82042d11bf8de89adbe09cb210d061fe08eb11743756f20eef26f918bbfd39","observation_id":"173395fb-7368-4c4f-b63f-80dfdb7132cc","resolution":{"observed_at":"2026-08-12T20:54:07.872469Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.854727Z","title":null,"venue":null,"work_id":"17a59068-b18b-4b92-a326-45dc62d0bac7","year":2024},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.460798Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:e7117ad7dc428da66d622a6d09d5facfa2de75489d7400355937451b8263aa19","observation_id":"25788515-cd77-4579-a5e9-2a1afa0ef717","resolution":{"observed_at":"2026-08-12T20:54:07.858897Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.01201","last_updated":"2022-10-10T04:46:32Z","snapshot_observed_at":"2026-08-13T15:30:59.391862Z","submitted_at":"2022-06-02T17:59:56Z","title":"REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering","version":2},"cited_work":{"arxiv_id":"2206.01201","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.01201","snapshot_observed_at":"2026-08-12T20:54:07.726034Z","title":"REVIVE: Regional Visual Representation Matters in Knowledge-Based Visual Question Answering","venue":"cs.CV","work_id":"12b77f3b-8682-4338-b547-40aaea815b47","year":2022},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.465522Z"},"links":{"cited_paper":"/paper/2206.01201","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:0cde1ce1e85a29162c321806ba6fa3f1e2c30a1d2388ae9abcb162fa00f646e3","observation_id":"708ae07d-8d11-44b7-bf6f-151d4b416632","resolution":{"observed_at":"2026-08-12T20:54:07.731682Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10774","last_updated":"2024-04-15T15:48:48Z","snapshot_observed_at":"2026-08-13T05:24:19.604847Z","submitted_at":"2023-11-15T23:36:42Z","title":"MMC: Advancing Multimodal Chart Understanding with Large-scale Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10774","snapshot_observed_at":"2026-08-12T20:54:07.469910Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.469910Z"},"links":{"cited_paper":"/paper/2311.10774","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:d2346078ed18da2ff049f5ea86fd5324c2dafd7b3ff1ed861e25abd6e6484eb1","observation_id":"169630e9-0429-494f-9a41-dc87ed48384c","resolution":{"observed_at":"2026-08-12T20:54:07.469910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08124","last_updated":"2020-07-16T05:52:16Z","snapshot_observed_at":"2026-08-10T13:06:17.421919Z","submitted_at":"2020-07-16T05:52:16Z","title":"LogiQA: A Challenge Dataset for Machine Reading Comprehension with Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.08124","snapshot_observed_at":"2026-08-12T20:54:07.474475Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.474475Z"},"links":{"cited_paper":"/paper/2007.08124","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:2d92e1200a7d6920120d32a12ddddaf3258b4bab06cc4e15e27a3155fdb74f06","observation_id":"e5630906-671a-4101-a529-86440425b3af","resolution":{"observed_at":"2026-08-12T20:54:07.474475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05256","last_updated":"2023-11-10T18:40:44Z","snapshot_observed_at":"2026-08-13T05:28:14.467529Z","submitted_at":"2023-11-10T18:40:44Z","title":"Holistic Evaluation of GPT-4V for Biomedical Imaging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.05256","snapshot_observed_at":"2026-08-12T20:54:07.478765Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.478765Z"},"links":{"cited_paper":"/paper/2312.05256","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:6ea223a6b2790e23248d262902004d706dd6324dd1b0dfb5b958876fa14c4aa0","observation_id":"dfad09cf-86c1-47c4-928a-d901d0ce2fb9","resolution":{"observed_at":"2026-08-12T20:54:07.478765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-12T20:54:07.483516Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.483516Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:2f7973e32406ae75351b43b39b41f6e42149035666d746f6458e24a2a5bd4c92","observation_id":"71c677c3-a823-455f-8497-157ebd9d8833","resolution":{"observed_at":"2026-08-12T20:54:07.483516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16809","last_updated":"2023-10-29T10:59:21Z","snapshot_observed_at":"2026-08-13T05:40:29.652858Z","submitted_at":"2023-10-25T17:38:55Z","title":"Exploring OCR Capabilities of GPT-4V(ision) : A Quantitative and In-depth Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16809","snapshot_observed_at":"2026-08-12T20:54:07.487795Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.487795Z"},"links":{"cited_paper":"/paper/2310.16809","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:30a4fd76a748db50e3e4b9b4faabee452f6c751f06a7bd98a340082edec7ae5b","observation_id":"747fecb6-0335-46e2-92d3-675deca4df85","resolution":{"observed_at":"2026-08-12T20:54:07.487795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05332","last_updated":"2023-11-28T09:47:57Z","snapshot_observed_at":"2026-08-13T07:20:13.996757Z","submitted_at":"2023-11-09T12:58:37Z","title":"On the Road with GPT-4V(ision): Early Explorations of Visual-Language Model on Autonomous Driving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05332","snapshot_observed_at":"2026-08-12T20:54:07.492582Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.492582Z"},"links":{"cited_paper":"/paper/2311.05332","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:b3e1e7fb770e7b97ca5f1e7bd42518496bee0fae2c516ae4107543201cc85203","observation_id":"60417d2c-4c4c-42ff-aa95-11c697188820","resolution":{"observed_at":"2026-08-12T20:54:07.492582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09909","last_updated":"2023-12-04T14:13:35Z","snapshot_observed_at":"2026-08-13T14:45:20.355992Z","submitted_at":"2023-10-15T18:32:27Z","title":"Can GPT-4V(ision) Serve Medical Applications? Case Studies on GPT-4V for Multimodal Medical Diagnosis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09909","snapshot_observed_at":"2026-08-12T20:54:07.496787Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.496787Z"},"links":{"cited_paper":"/paper/2310.09909","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:34282e5e315c3f061dfb193469f5f6d6d388b4636826864923c51174b1249167","observation_id":"8cbd03d4-cb4a-48de-bce0-0ff089a6e322","resolution":{"observed_at":"2026-08-12T20:54:07.496787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17421","last_updated":"2023-10-11T05:07:37Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:34:51Z","title":"The Dawn of LMMs: Preliminary Explorations with GPT-4V(ision)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17421","snapshot_observed_at":"2026-08-12T20:54:07.501393Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.501393Z"},"links":{"cited_paper":"/paper/2309.17421","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:c7ed8d0b5328c78eed0aefcc097a03df29d500ee8131a6f91a8fcf8b3ce4757b","observation_id":"df4ba4a0-9376-4e86-b025-ed0616e0cbac","resolution":{"observed_at":"2026-08-12T20:54:07.501393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08821","last_updated":"2023-04-18T08:40:30Z","snapshot_observed_at":"2026-08-13T12:00:21.782055Z","submitted_at":"2023-04-18T08:40:30Z","title":"TTIDA: Controllable Generative Data Augmentation via Text-to-Text and Text-to-Image Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08821","snapshot_observed_at":"2026-08-12T20:54:07.505703Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.505703Z"},"links":{"cited_paper":"/paper/2304.08821","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:2042da41e0849a03bfabca047c6baffe207207485908523e2841003913d09df8","observation_id":"a7b99f50-89af-42a4-9dd8-568a1248705d","resolution":{"observed_at":"2026-08-12T20:54:07.505703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.00685","last_updated":"2024-02-16T10:28:12Z","snapshot_observed_at":"2026-08-13T12:10:42.075004Z","submitted_at":"2023-04-03T02:17:05Z","title":"Vision-Language Models for Vision Tasks: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.00685","snapshot_observed_at":"2026-08-12T20:54:07.510156Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.510156Z"},"links":{"cited_paper":"/paper/2304.00685","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:5523a85febcacd61c76abcac1235acd0c774d3600f5d6a0ba1de6544deb11158","observation_id":"9977f2fe-3ea0-4ba3-9174-c8bdabe0dd7a","resolution":{"observed_at":"2026-08-12T20:54:07.510156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16339","last_updated":"2023-10-24T04:38:52Z","snapshot_observed_at":"2026-08-13T11:35:00.888013Z","submitted_at":"2023-05-24T02:05:03Z","title":"Don't Trust ChatGPT when Your Question is not in English: A Study of Multilingual Abilities and Types of LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16339","snapshot_observed_at":"2026-08-12T20:54:07.514494Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.514494Z"},"links":{"cited_paper":"/paper/2305.16339","citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:fa278be6f545e5e617bfd958c29bb3ab5f423d788bb69076b0e0336d25f1c300","observation_id":"fb0be602-3bde-49bc-88ba-ab77ffafce5f","resolution":{"observed_at":"2026-08-12T20:54:07.514494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.eacl-main.205","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.556509Z","title":null,"venue":null,"work_id":"56de35ac-b991-4055-8ac2-ee4469950f2e","year":2023},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.519013Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:e90eb7cf547efc1b89474ec08e314037b1d268e7e1e0e49cc0982d3bf8b013e0","observation_id":"f670afd0-93fd-426e-9b8b-5d241d8103cc","resolution":{"observed_at":"2026-08-12T20:54:07.561794Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.523015Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.523015Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:a2eaaecb7ec8acadcbc1f726c73dc5d7b31df9b1c3a4c507a0f8e2eff9a42ecd","observation_id":"450f71d2-0fe0-41e9-b5f6-844c49a01c94","resolution":{"observed_at":"2026-08-12T20:54:07.523015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T20:54:07.527927Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T20:54:07.527927Z"},"links":{"citing_paper":"/paper/2411.09273"},"observation_digest":"sha256:de549d77854ca654332bfee2b2f09f155cc712d0a1aa59c0c83d81104304ad5b","observation_id":"7aaf04ab-ca56-4471-9cce-da84e8458829","resolution":{"observed_at":"2026-08-12T20:54:07.527927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.09273","last_updated":"2024-11-14T08:22:42Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T22:57:44.060170Z","submitted_at":"2024-11-14T08:22:42Z","title":"Cross-Modal Consistency in Multimodal Large Language Models"},"reference_resolution":{"displayed":24,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":2,"verified_fuzzy":0},"total_outbound_references":24},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 24 of 24 outbound references and 4 inbound Pith citation observations for arXiv:2411.09273."}