{"as_of":"2026-08-08T01:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:40215d07855cc1806ac0fda8055146675e90047978df2bd97eb5099dfa6e9388","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:01:25.978139Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20236/citation-record","integrity":"/paper/2505.20236/integrity","json":"/paper/2505.20236/citation-record.json","paper":"/paper/2505.20236"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-07T14:01:22.013740Z","title":"Jiang, Kartik Khandelwal, Timothée Lacroix, Guillaume Lample, Diego Las Casas, Thibaut Lavril, and 23 others","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.013740Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:381dd00271a4ee364ed31e74e44b0fee41fea76778c08402f2746282b67e61a3","observation_id":"577c4f42-b60b-44d0-bc42-e6663dffb170","resolution":{"observed_at":"2026-08-07T14:01:22.013740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-07T14:01:22.100408Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.100408Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:766d228db4f2a55873369c9bd60138f7bba691196af682443a78b1baed8c303a","observation_id":"d8bd690b-7249-45e7-9db2-74af12102b38","resolution":{"observed_at":"2026-08-07T14:01:22.100408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:27.828028Z","title":null,"venue":null,"work_id":"282a123f-4038-4e86-a37c-dc6be012b44e","year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.201998Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:5c7aaa72d1873eb179b54a1d430af4c144a0eaaf9b1bc233f8a61630a5d15994","observation_id":"368f3ad0-0e61-4f1a-be60-79e97a696b23","resolution":{"observed_at":"2026-08-07T14:01:27.934825Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17196","last_updated":"2024-12-11T15:45:21Z","snapshot_observed_at":"2026-07-06T19:37:56.214143Z","submitted_at":"2024-10-22T17:15:20Z","title":"VoiceBench: Benchmarking LLM-Based Voice Assistants","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17196","snapshot_observed_at":"2026-08-07T14:01:22.298371Z","title":"Tan, and Haizhou Li","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.298371Z"},"links":{"cited_paper":"/paper/2410.17196","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:8b6107d622dc5fa6e806de5a90efcd226b5a86ee67eec04f603e8c1790a553f6","observation_id":"46b8f820-b59d-47cc-9e92-8bb0df96f279","resolution":{"observed_at":"2026-08-07T14:01:22.298371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:27.539227Z","title":null,"venue":null,"work_id":"67dde542-d888-41ca-96c0-c0e2e7b31c16","year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.367415Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:cdb5aba75ec73b209a9d4ad634c48357f210278b23bb9b2f2e16f644ea92a2d5","observation_id":"0a8a4407-06e2-42a4-a39d-1c84d66a1c4a","resolution":{"observed_at":"2026-08-07T14:01:27.635100Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16656","last_updated":"2025-06-06T07:27:18Z","snapshot_observed_at":"2026-08-07T15:59:55.050120Z","submitted_at":"2025-04-23T12:24:10Z","title":"Skywork R1V2: Multimodal Hybrid Reinforcement Learning for Reasoning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16656","snapshot_observed_at":"2026-08-07T14:01:22.483974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.483974Z"},"links":{"cited_paper":"/paper/2504.16656","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:1871087a640b5172862be172213e7b56208d854878b634d0ed27b14f7602421a","observation_id":"c52f5b08-33f5-4921-a7eb-fdd7fb77eefd","resolution":{"observed_at":"2026-08-07T14:01:22.483974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:22.586032Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.586032Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:92b34764abff313da1b833317f8bf237a52cab7765f017c6d1b7525e04cee658","observation_id":"0584dd42-db82-4da3-bdb9-921479950611","resolution":{"observed_at":"2026-08-07T14:01:22.586032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:22.692185Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.692185Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:5f373be92d287a4da2ab796e24052bc95adb924134b241195244d5c70ff59a84","observation_id":"520fad86-b4f8-4cbc-82cd-e83f17e10919","resolution":{"observed_at":"2026-08-07T14:01:22.692185Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-07-06T17:54:03.923842Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-08-07T14:01:22.788224Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.788224Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:fb0046560cd3cb94fc2b5295b1430830770e410fa65734de5d5eec7bd5ad9ea9","observation_id":"839f82ac-2372-4ace-ae8b-7ca6f029ae5a","resolution":{"observed_at":"2026-08-07T14:01:22.788224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T14:01:22.912852Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:22.912852Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:4ce109edcef318622990ea0597b92bed3ae28fcda880b9d0200e8a5cd1e0f557","observation_id":"a0186ef2-f6bd-45a8-b24c-b4e3f6cb4faa","resolution":{"observed_at":"2026-08-07T14:01:22.912852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.025879Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.025879Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:9c67623e1bc84230d204e28151ad5d54e60d3832a872f0eebae3b5a66aac28ee","observation_id":"fbe1f2cb-9467-4b61-be0e-41a1325d5fe6","resolution":{"observed_at":"2026-08-07T14:01:23.025879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.143535Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.143535Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:4cb8d67eb343ca3874a0506f3276e5335c9f88b6e0cbae3a270e8f5d6de26f75","observation_id":"783aeaef-3f43-4248-90a0-ca1006418410","resolution":{"observed_at":"2026-08-07T14:01:23.143535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13826","last_updated":"2025-01-23T16:51:47Z","snapshot_observed_at":"2026-07-06T20:25:03.950783Z","submitted_at":"2025-01-23T16:51:47Z","title":"Video-MMMU: Evaluating Knowledge Acquisition from Multi-Discipline Professional Videos","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.13826","snapshot_observed_at":"2026-08-07T14:01:23.214406Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.214406Z"},"links":{"cited_paper":"/paper/2501.13826","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:27889fa9d5cab2cc28ed00f6ea31311372b814f764c1a9b715acef667e824203","observation_id":"2bf9ee16-4a31-4cbb-a89b-bbbe64aa3707","resolution":{"observed_at":"2026-08-07T14:01:23.214406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07491","last_updated":"2025-06-23T13:45:50Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-10T06:48:26Z","title":"Kimi-VL Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07491","snapshot_observed_at":"2026-08-07T14:01:23.280081Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.280081Z"},"links":{"cited_paper":"/paper/2504.07491","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:e537a09e75ce0600bbbff10dd6fd8aa9d04def8800cf5e4c86a2f298a360b242","observation_id":"f7a87000-bebd-4d58-9554-fd88f6ea092e","resolution":{"observed_at":"2026-08-07T14:01:23.280081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.09664","snapshot_observed_at":"2026-08-07T14:01:23.379055Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.379055Z"},"links":{"cited_paper":"/paper/2302.09664","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:3f4902610a959c188fc318ec5d36052ede331bdd39e34da29e5809dac182bd44","observation_id":"660bbce5-be51-4d44-8c54-537bd684d169","resolution":{"observed_at":"2026-08-07T14:01:23.379055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-07T14:01:23.443069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.443069Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:7ef0227c477c6c8d55bb1b3d62c14e4cd03248c344fe82dcf592d50f74f06453","observation_id":"d4e6d02b-185a-47c8-b668-a2626a337952","resolution":{"observed_at":"2026-08-07T14:01:23.443069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.511582Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.511582Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:cabbc6337fde7a156dc2f165dfae92d21ec174881062d32ec2a695b71a401e72","observation_id":"8db16a5d-58ee-48fd-b298-057a8c3876c4","resolution":{"observed_at":"2026-08-07T14:01:23.511582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.17647","last_updated":"2024-06-10T23:39:24Z","snapshot_observed_at":"2026-07-06T16:54:22.039181Z","submitted_at":"2023-11-29T14:08:53Z","title":"Text as Images: Can Multimodal Large Language Models Follow Printed Instructions in Pixels?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.17647","snapshot_observed_at":"2026-08-07T14:01:23.643676Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.643676Z"},"links":{"cited_paper":"/paper/2311.17647","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:84694bcc1f769a1e8143b97f5954fe3e59ae5cd4a81a9e36e78fa4e5e6a097ff","observation_id":"12de5b99-01a3-4278-83ce-e0e4dd4be166","resolution":{"observed_at":"2026-08-07T14:01:23.643676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14334","last_updated":"2022-06-13T05:04:53Z","snapshot_observed_at":"2026-08-03T04:20:54.522222Z","submitted_at":"2022-05-28T05:02:31Z","title":"Teaching Models to Express Their Uncertainty in Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14334","snapshot_observed_at":"2026-08-07T14:01:23.760219Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.760219Z"},"links":{"cited_paper":"/paper/2205.14334","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:be8609e2a7b365bcae04d97cd8a8f5ba91f9da388e4b0cb64c5a5f6e98cdcdbf","observation_id":"5fa8cfb7-796a-42b6-932c-c9a508807abb","resolution":{"observed_at":"2026-08-07T14:01:23.760219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.883414Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.883414Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:7b14527803f3cd2f48715b7d8e727b07e653265612343ef1e807d9a0a7c0ec86","observation_id":"31ac3cbe-04e4-4174-ae7b-6b35555b57ab","resolution":{"observed_at":"2026-08-07T14:01:23.883414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:23.976050Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:23.976050Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:964ecb92de651926b4f655628868428512f3b584eb313318d523f06d6fa0b152","observation_id":"9b1faf96-b556-46f0-a79c-9c9a84189980","resolution":{"observed_at":"2026-08-07T14:01:23.976050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04263","last_updated":"2025-02-06T17:58:59Z","snapshot_observed_at":"2026-07-06T20:32:18.814472Z","submitted_at":"2025-02-06T17:58:59Z","title":"Cross the Gap: Exposing the Intra-modal Misalignment in CLIP via Modality Inversion","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.04263","snapshot_observed_at":"2026-08-07T14:01:24.087885Z","title":"Bagdanov","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.087885Z"},"links":{"cited_paper":"/paper/2502.04263","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:b3a2babbc9b388f047b000b838cdfd10eb4be3e550168fb5a9b7cddc793b2c7a","observation_id":"421bfe05-7e31-41b5-ad92-4b487724c3f8","resolution":{"observed_at":"2026-08-07T14:01:24.087885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20003","last_updated":"2024-05-30T12:42:05Z","snapshot_observed_at":"2026-07-06T18:22:40.048076Z","submitted_at":"2024-05-30T12:42:05Z","title":"Kernel Language Entropy: Fine-grained Uncertainty Quantification for LLMs from Semantic Similarities","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20003","snapshot_observed_at":"2026-08-07T14:01:24.159098Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.159098Z"},"links":{"cited_paper":"/paper/2405.20003","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:5acabf3a06b46c38795eb7f32dc63b43a0186e40b025244f0657613bb47772bd","observation_id":"bda0b752-27ba-482c-a26b-fef51d8d9cea","resolution":{"observed_at":"2026-08-07T14:01:24.159098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06807","last_updated":"2025-02-18T22:21:40Z","snapshot_observed_at":"2026-08-05T15:21:07.825807Z","submitted_at":"2025-02-03T23:00:15Z","title":"Competitive Programming with Large Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.06807","snapshot_observed_at":"2026-08-07T14:01:24.248102Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.248102Z"},"links":{"cited_paper":"/paper/2502.06807","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:0dd217878cf1edec22a499c3f5297175fbeba32c218a24b76303e5b581500d99","observation_id":"784c145e-d28b-486f-8ede-99c514aad554","resolution":{"observed_at":"2026-08-07T14:01:24.248102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T14:01:24.321343Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.321343Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:64a0ad1471a2609968852e2687dee607b92290a01ba4d29a204345ca77470f3b","observation_id":"1369b012-4f31-40f6-beb0-002c58439b0d","resolution":{"observed_at":"2026-08-07T14:01:24.321343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T14:01:24.419906Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.419906Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:96af2ce8aea9669503673cc1d26e59a9a654877e94e3adace74d42017cb62d4d","observation_id":"299fdc9e-7526-4e0d-aac4-2a71948a3229","resolution":{"observed_at":"2026-08-07T14:01:24.419906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.515708Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.515708Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:ec8122884b4438ba4590ec9dc297b02635449b19ff50ebc0229c49e620064c67","observation_id":"73f42e94-ba71-46a6-9b1d-6bc050c3a39c","resolution":{"observed_at":"2026-08-07T14:01:24.515708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02287","last_updated":"2024-05-03T17:59:55Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:59:55Z","title":"Vibe-Eval: A hard evaluation suite for measuring progress of multimodal language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.02287","snapshot_observed_at":"2026-08-07T14:01:24.600283Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.600283Z"},"links":{"cited_paper":"/paper/2405.02287","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:086bee1e73bbc0d8597c75b8f93382966e76e22634fb22fe7c32f3c627fdfc81","observation_id":"f0e75ab4-d008-43ec-b0e7-367f2f3232d2","resolution":{"observed_at":"2026-08-07T14:01:24.600283Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05599","last_updated":"2025-06-09T11:44:18Z","snapshot_observed_at":"2026-08-07T16:07:44.263463Z","submitted_at":"2025-04-08T01:19:20Z","title":"Skywork R1V: Pioneering Multimodal Reasoning with Chain-of-Thought","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05599","snapshot_observed_at":"2026-08-07T14:01:24.672118Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.672118Z"},"links":{"cited_paper":"/paper/2504.05599","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:0d18debc4aab11463a7f56f24efbf279a0f68f823900e3dcbf62323667007a53","observation_id":"29f1d055-0c40-4292-bd67-dbf5c2773828","resolution":{"observed_at":"2026-08-07T14:01:24.672118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.745046Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.745046Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:b53ed103170bde10146a435bd0dd6e8f04cbb48c44493d939481c91f9f53a109","observation_id":"4c7c4b9e-7866-42ff-b8c3-bd4ba4b8fde3","resolution":{"observed_at":"2026-08-07T14:01:24.745046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.847837Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.847837Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:36a3ad1b7069778d3098f47720bdd0de15e5024165c7922509f6b90426339ed4","observation_id":"96363283-fa5d-4d18-81af-988b2ada11e7","resolution":{"observed_at":"2026-08-07T14:01:24.847837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:24.911865Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.911865Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:90c1bd9c337fafde23f0f1c9e88d629c6d859fd9520b5fdd7eff57eb61aa3d8e","observation_id":"f9d64c17-4280-444f-b441-c7b5b070541e","resolution":{"observed_at":"2026-08-07T14:01:24.911865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:27.222836Z","title":null,"venue":null,"work_id":"b7703fd4-c580-4a06-aee8-be58529496ec","year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:24.995849Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:0a4fe481747c30bb7f6d0c64befcb3edcaf5120585f73cfd98893054c444b564","observation_id":"a72a6b96-0e25-4210-bb07-e86db1b9b0f8","resolution":{"observed_at":"2026-08-07T14:01:27.346906Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06492","last_updated":"2025-03-09T07:25:32Z","snapshot_observed_at":"2026-08-07T17:19:21.009730Z","submitted_at":"2025-03-09T07:25:32Z","title":"VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering","version":1},"cited_work":{"arxiv_id":"2503.06492","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.06492","snapshot_observed_at":"2026-08-07T14:01:26.424935Z","title":"VisualSimpleQA: A Benchmark for Decoupled Evaluation of Large Vision-Language Models in Fact-Seeking Question Answering","venue":"cs.CL","work_id":"4d21c30a-e59f-4626-96b3-7cff3c93037e","year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.047482Z"},"links":{"cited_paper":"/paper/2503.06492","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:aa72c430bd256f743dd3f827b1973d5b7dce14daa7411f0434ab77e66a4a5d9e","observation_id":"65e97d08-87bc-493e-a73f-9e4b9d3f9984","resolution":{"observed_at":"2026-08-07T14:01:26.473041Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13063","last_updated":"2024-03-17T04:38:48Z","snapshot_observed_at":"2026-07-06T15:45:39.649725Z","submitted_at":"2023-06-22T17:31:44Z","title":"Can LLMs Express Their Uncertainty? An Empirical Evaluation of Confidence Elicitation in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13063","snapshot_observed_at":"2026-08-07T14:01:25.160503Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.160503Z"},"links":{"cited_paper":"/paper/2306.13063","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:edbf420a2d412d48bfca278744f3c02d3b1697777b190cad4eaaff0b25bcd203","observation_id":"49fca5c3-60ad-4a8b-8911-1f4f555b816d","resolution":{"observed_at":"2026-08-07T14:01:25.160503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.253135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.253135Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:ac266b8b860cf759d83220ec8438f2dfa25fc66b43710a9271aa71f189eadf4e","observation_id":"0023d82c-4754-4593-bf77-e98fe5ffe04f","resolution":{"observed_at":"2026-08-07T14:01:25.253135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14737","last_updated":"2026-05-05T09:22:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T11:10:36Z","title":"On Verbalized Confidence Scores for LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14737","snapshot_observed_at":"2026-08-07T14:01:25.362381Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.362381Z"},"links":{"cited_paper":"/paper/2412.14737","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:8e4f090138d85ae8c51de239faca0d20b7e5941126d6137f35ba030c4fe8f131","observation_id":"32e8d7ba-05ad-43b1-b1ed-a0a1ee967a4e","resolution":{"observed_at":"2026-08-07T14:01:25.362381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-07T14:01:25.453877Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.453877Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:79e94b5f4004881a1775fe0f4bf94b07024acd65265e9809725fbe4c29124106","observation_id":"e2430b32-9e4a-421e-8186-4e9ec2ca701e","resolution":{"observed_at":"2026-08-07T14:01:25.453877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.547974Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.547974Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:a1e056eca444f1a3975db4a282424ea9e2e44eec5551ed7f8d9f4ba8f81fbf53","observation_id":"e87c8039-d94f-47b3-bd9c-671458260439","resolution":{"observed_at":"2026-08-07T14:01:25.547974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14848","last_updated":"2025-04-21T04:01:22Z","snapshot_observed_at":"2026-08-07T16:00:41.922151Z","submitted_at":"2025-04-21T04:01:22Z","title":"Object-Level Verbalized Confidence Calibration in Vision-Language Models via Semantic Perturbation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14848","snapshot_observed_at":"2026-08-07T14:01:25.677292Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.677292Z"},"links":{"cited_paper":"/paper/2504.14848","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:cae4bea6511636f17ac4b30d6e58047fd8ee746afc7b49ccc8ef5f46fcf6293e","observation_id":"c62b61a3-1ded-4373-b33f-4ac3ef07d44f","resolution":{"observed_at":"2026-08-07T14:01:25.677292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T14:01:25.765160Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.765160Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:ee126837ceeddc060a171e68a29e159a1ce0e31dcf08279a0cbb5a0802c1e06f","observation_id":"38df3b57-ede7-4009-858b-2ca0244844da","resolution":{"observed_at":"2026-08-07T14:01:25.765160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-08-07T14:01:25.854052Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.854052Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:458bc5a031ddd6e0dad1eb0afc109303e5042fea821c82291ba11ab26dfc333b","observation_id":"bbe0ee83-2b7a-4ec4-b01a-5d9eb00677f7","resolution":{"observed_at":"2026-08-07T14:01:25.854052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.922314Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.922314Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:7904677af7cc4536f69292d1bbc278cc9fd2403d485028ebfcf3f7baa46d6aa8","observation_id":"634c2005-6315-4346-a502-bac238a50906","resolution":{"observed_at":"2026-08-07T14:01:25.922314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:01:25.978139Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T14:01:25.978139Z"},"links":{"citing_paper":"/paper/2505.20236"},"observation_digest":"sha256:27714d96bafbd02eb2ddfac2d8998463d386035dd40b0fd0032db9f761ac1aea","observation_id":"deb1b7ee-7405-4a9c-bcc0-52673db637c7","resolution":{"observed_at":"2026-08-07T14:01:25.978139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.20236","last_updated":"2025-05-26T17:16:36Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T13:54:23.640348Z","submitted_at":"2025-05-26T17:16:36Z","title":"Seeing is Believing, but How Much? A Comprehensive Analysis of Verbalized Calibration in Vision-Language Models"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 0 inbound Pith citation observations for arXiv:2505.20236."}