{"as_of":"2026-08-09T06:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c1affd4049e64ae8af9fc835f9e4349ff9401bbd883e7aa35dd66faa6c9e3cc0","coverage":[{"denominator":26,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T11:11:20.896514Z","state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06994/citation-record","integrity":"/paper/2509.06994/integrity","json":"/paper/2509.06994/citation-record.json","paper":"/paper/2509.06994"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2103.00020","last_updated":"2021-02-26T19:04:58Z","snapshot_observed_at":"2026-07-06T10:45:03.059688Z","submitted_at":"2021-02-26T19:04:58Z","title":"Learning Transferable Visual Models From Natural Language Supervision","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.00020","snapshot_observed_at":"2026-08-05T11:11:20.756776Z","title":"Radford, J","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.756776Z"},"links":{"cited_paper":"/paper/2103.00020","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:e6ba291ec1b45814d7e2b0d9af0b225f929ee3521ff5fea9a3caefba451b7193","observation_id":"25d29911-204a-4527-85e4-62c23e6e7ad1","resolution":{"observed_at":"2026-08-05T11:11:20.756776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2102.05918","last_updated":"2021-06-11T07:51:39Z","snapshot_observed_at":"2026-07-06T10:40:28.145954Z","submitted_at":"2021-02-11T10:08:12Z","title":"Scaling Up Visual and Vision-Language Representation Learning With Noisy Text Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2102.05918","snapshot_observed_at":"2026-08-05T11:11:20.762326Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.762326Z"},"links":{"cited_paper":"/paper/2102.05918","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:cdd383388178ff877ea6e20d5ecd465de99e453d8bea6f87ad58b9de5ba35b84","observation_id":"2504c725-81df-4bb4-873e-cf83c4670f93","resolution":{"observed_at":"2026-08-05T11:11:20.762326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.12597","snapshot_observed_at":"2026-08-05T11:11:20.767242Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.767242Z"},"links":{"cited_paper":"/paper/2301.12597","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:db31567cd068539b001f4f2da14ed358e69bf635339e029cf5078772b6935b1a","observation_id":"3dc30fb9-740f-40dd-a8f9-893cf054f866","resolution":{"observed_at":"2026-08-05T11:11:20.767242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06500","last_updated":"2023-06-15T08:00:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-11T00:38:10Z","title":"InstructBLIP: Towards General-purpose Vision-Language Models with Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06500","snapshot_observed_at":"2026-08-05T11:11:20.772877Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.772877Z"},"links":{"cited_paper":"/paper/2305.06500","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:0ce75a49ae6d009e6d8548d5ce104dc7f12d7623190884d33c2a7bfc741b12b1","observation_id":"a95b629f-7b0e-476b-863a-9eff8deca0af","resolution":{"observed_at":"2026-08-05T11:11:20.772877Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-05T11:11:20.778714Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.778714Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:eba757c8ccd626dc3aec5af81dddc9e8dc1850dcd78a65f298cd20e09834ff32","observation_id":"125b24fd-37ce-4e92-8b67-0a961774bd46","resolution":{"observed_at":"2026-08-05T11:11:20.778714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-05T11:11:20.784030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.784030Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:7c5fa04978af0ec53363e620eee92e68a8bcdce37e6483edcdd256086601b827","observation_id":"25f20eff-fa39-4a1d-8d7d-3b9923386019","resolution":{"observed_at":"2026-08-05T11:11:20.784030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.14238","last_updated":"2024-01-15T15:23:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-21T18:59:31Z","title":"InternVL: Scaling up Vision Foundation Models and Aligning for Generic Visual-Linguistic Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.14238","snapshot_observed_at":"2026-08-05T11:11:20.790509Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.790509Z"},"links":{"cited_paper":"/paper/2312.14238","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:6734c60ed654550331c117d0c54eb21cff3cb4302f751e438c2ddd44f2a438fa","observation_id":"57ce2f51-1090-450f-8057-65b228fe2d21","resolution":{"observed_at":"2026-08-05T11:11:20.790509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16502","last_updated":"2024-06-13T15:02:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-27T17:33:21Z","title":"MMMU: A Massive Multi-discipline Multimodal Understanding and Reasoning Benchmark for Expert AGI","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16502","snapshot_observed_at":"2026-08-05T11:11:20.795205Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.795205Z"},"links":{"cited_paper":"/paper/2311.16502","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:301f30db09dcc12d2494537800020976512fe4cc3163a5e4614e8de909bea285","observation_id":"b49cb21d-d80a-4e59-ae9f-78a74c7026e6","resolution":{"observed_at":"2026-08-05T11:11:20.795205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:11:21.758748Z","title":null,"venue":null,"work_id":"0c8ec857-225b-4992-b6a2-6660a0c23192","year":2022},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.800168Z"},"links":{"citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:94b0ed22900faf88e708da48f78117975afdd775f9a0510fb52e050cc7b5a230","observation_id":"28ca6039-9c4f-4e14-b15b-487c61ac902a","resolution":{"observed_at":"2026-08-05T11:11:21.766317Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-07-06T16:27:15.027202Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-05T11:11:20.804751Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.804751Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:50aa9efb3330979d6623b498186aa73b654211df4db16680016c5b3f50a17ceb","observation_id":"9ae5c169-ec7d-478d-bca4-ac87619a245b","resolution":{"observed_at":"2026-08-05T11:11:20.804751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13394","last_updated":"2025-10-24T02:45:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-23T09:22:36Z","title":"MME: A Comprehensive Evaluation Benchmark for Multimodal Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13394","snapshot_observed_at":"2026-08-05T11:11:20.810277Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.810277Z"},"links":{"cited_paper":"/paper/2306.13394","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:0f86ad86ed8a88460500c52fd5f42be6ae178b3376507ae12a83b7e50e06d82c","observation_id":"f7ab3902-57b5-4892-9090-bb475f8b8cea","resolution":{"observed_at":"2026-08-05T11:11:20.810277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-05T11:11:20.816367Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.816367Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:f29dae2dbb0e5a7fc4ce8f49a8253d9d8c05211f124a266e48213b85acf678ec","observation_id":"81de8b30-b5c4-49e4-a8f0-2efdf15f0475","resolution":{"observed_at":"2026-08-05T11:11:20.816367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10355","last_updated":"2023-10-26T02:52:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T16:34:01Z","title":"Evaluating Object Hallucination in Large Vision-Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10355","snapshot_observed_at":"2026-08-05T11:11:20.821484Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.821484Z"},"links":{"cited_paper":"/paper/2305.10355","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:6f0072184a147b43dde1af30596e263c667a3e1526d2ad88b4625ab5d99fc395","observation_id":"92a070ab-54e3-4f19-acb7-99389f5a1150","resolution":{"observed_at":"2026-08-05T11:11:20.821484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08920","last_updated":"2019-05-13T23:28:48Z","snapshot_observed_at":"2026-07-06T07:47:04.116217Z","submitted_at":"2019-04-18T17:55:37Z","title":"Towards VQA Models That Can Read","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08920","snapshot_observed_at":"2026-08-05T11:11:20.827420Z","title":"Singh, V","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.827420Z"},"links":{"cited_paper":"/paper/1904.08920","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:763aee464adc292ef552642a179b30a095ba237d809e2dc6a0f1286d1573fed9","observation_id":"79822f8d-424e-4bce-8edd-cbd1201db123","resolution":{"observed_at":"2026-08-05T11:11:20.827420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2007.00398","last_updated":"2021-01-05T05:39:39Z","snapshot_observed_at":"2026-08-09T03:04:05.322043Z","submitted_at":"2020-07-01T11:37:40Z","title":"DocVQA: A Dataset for VQA on Document Images","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.00398","snapshot_observed_at":"2026-08-05T11:11:20.832097Z","title":"Mathew, D","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.832097Z"},"links":{"cited_paper":"/paper/2007.00398","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:35d3ad7a732457d374fc32e8c8d3ad04673127d4d0e6ace0761aedeb233bc0f5","observation_id":"2b5709b0-a04a-4bd6-87d9-71b46c381cc6","resolution":{"observed_at":"2026-08-05T11:11:20.832097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T11:11:20.836873Z","title":"Masry, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.836873Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:b6de2e10382512caab289f65ffef1423f6832011cdeaea99716540c894a27d42","observation_id":"f7336672-e16d-4c2b-91ac-d8155104ff79","resolution":{"observed_at":"2026-08-05T11:11:20.836873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1603.07396","last_updated":"2016-03-24T00:02:58Z","snapshot_observed_at":"2026-08-07T19:22:55.853637Z","submitted_at":"2016-03-24T00:02:58Z","title":"A Diagram Is Worth A Dozen Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1603.07396","snapshot_observed_at":"2026-08-05T11:11:20.842285Z","title":"Kembhavi, M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.842285Z"},"links":{"cited_paper":"/paper/1603.07396","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:1b44261ae9c4bbe6ab8fc9c4f7173c966e0c6a3feecc3f18437686d74db30acd","observation_id":"071e3566-2153-4815-ba45-743320f94247","resolution":{"observed_at":"2026-08-05T11:11:20.842285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21075","last_updated":"2025-05-30T13:08:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:59:47Z","title":"Video-MME: The First-Ever Comprehensive Evaluation Benchmark of Multi-modal LLMs in Video Analysis","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21075","snapshot_observed_at":"2026-08-05T11:11:20.847152Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.847152Z"},"links":{"cited_paper":"/paper/2405.21075","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:6585a8a9d627ed1a6e70777a47e104b242986d72d8841f57a128bdf1174a2cb9","observation_id":"61f6fb42-0646-4ab6-9d9d-70cffb7bfef7","resolution":{"observed_at":"2026-08-05T11:11:20.847152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:11:20.851633Z","title":"Redmon, S","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.851633Z"},"links":{"citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:54765e53da4ae7971cfdec9046d9eef21085459fc0b6361da801a01bbb32643b","observation_id":"593e1ea5-8e24-414b-bfa4-a69f352623d6","resolution":{"observed_at":"2026-08-05T11:11:20.851633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:11:20.862036Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.862036Z"},"links":{"citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:540d828179656b57d219166819807433fc3ebe9b9e2ddca135ac19fe62778b25","observation_id":"5e0164a0-d264-4499-a12d-187ea2623436","resolution":{"observed_at":"2026-08-05T11:11:20.862036Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:11:20.868016Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.868016Z"},"links":{"citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:68358bc94c6e2c500bcb8c44f49755f9de18ee0954dd896cba1fffaffaf44562","observation_id":"fe9e5a2d-8e5d-4476-a818-28d0902e21fa","resolution":{"observed_at":"2026-08-05T11:11:20.868016Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"4334.91209","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T11:11:21.149650Z","title":null,"venue":null,"work_id":"683e7222-6e17-495d-80b2-24d9723ae29e","year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.873379Z"},"links":{"citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:7d6066c1cbb44760e11e1e230861e87b7190779261f7e1fd9726ebe4bb178057","observation_id":"4035c6db-6ec6-4dd3-9421-f7f623789f78","resolution":{"observed_at":"2026-08-05T11:11:21.162277Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T11:11:20.878592Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.878592Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:a9e1c780c40d680a7562e28fd60222ddcc3dd13c9562a4c85e27b7bd6ae0522b","observation_id":"adec65b2-bbe4-4c14-90bf-310ef96b25da","resolution":{"observed_at":"2026-08-05T11:11:20.878592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03569","last_updated":"2025-06-04T04:32:54Z","snapshot_observed_at":"2026-08-07T10:57:30.804332Z","submitted_at":"2025-06-04T04:32:54Z","title":"MiMo-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03569","snapshot_observed_at":"2026-08-05T11:11:20.883362Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.883362Z"},"links":{"cited_paper":"/paper/2506.03569","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:d8e49489f49bb555effb175d44cda383e874d954b36aded0ce54d2bebcf94136","observation_id":"0c8d68e1-e4a3-49ab-ae44-cdf495f6c7a2","resolution":{"observed_at":"2026-08-05T11:11:20.883362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04569","last_updated":"2025-04-13T14:53:45Z","snapshot_observed_at":"2026-08-07T16:08:10.905076Z","submitted_at":"2025-04-06T17:58:08Z","title":"KnowsLM: A framework for evaluation of small language models for knowledge augmentation and humanised conversations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04569","snapshot_observed_at":"2026-08-05T11:11:20.890509Z","title":"KnowsLM: A framework for evaluation of small language models for knowledge augmentation and humanised conversations,","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.890509Z"},"links":{"cited_paper":"/paper/2504.04569","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:e552445f3199d9aa23b99de7480fc92ce76dd70ef8c3807897dcdfc1d2bc2bb5","observation_id":"e788a6a7-88ad-4c27-add2-a97b5fd6fea8","resolution":{"observed_at":"2026-08-05T11:11:20.890509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11424","last_updated":"2024-06-17T11:22:25Z","snapshot_observed_at":"2026-07-06T18:32:06.826381Z","submitted_at":"2024-06-17T11:22:25Z","title":"Evaluating the Efficacy of Open-Source LLMs in Enterprise-Specific RAG Systems: A Comparative Study of Performance and Scalability","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11424","snapshot_observed_at":"2026-08-05T11:11:20.896514Z","title":"Gautam and A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T11:11:20.896514Z"},"links":{"cited_paper":"/paper/2406.11424","citing_paper":"/paper/2509.06994"},"observation_digest":"sha256:debbd143f5ec5765168e87fdfc5640e45a49d8a7f802529aae9cc2f72cedf8af","observation_id":"ea359d5e-3ff9-41ae-9495-eb45cfce5b40","resolution":{"observed_at":"2026-08-05T11:11:20.896514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06994","last_updated":"2025-09-03T05:54:03Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T03:54:24.303922Z","submitted_at":"2025-09-03T05:54:03Z","title":"VLMs-in-the-Wild: Bridging the Gap Between Academic Benchmarks and Enterprise Reality"},"reference_resolution":{"displayed":26,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":26},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 26 of 26 outbound references and 0 inbound Pith citation observations for arXiv:2509.06994."}