{"as_of":"2026-08-07T01:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7c4bf33d5e1133e4935c97b09c2f6d0a6e3da082a60ff4859f9f74805dd8508f","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":16,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":16,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":16,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":16,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:19:58.185565Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":5,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2408.13257","last_updated":"2025-02-05T08:44:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-23T17:59:51Z","title":"MME-RealWorld: Could Your Multimodal LLM Challenge High-Resolution Real-World Scenarios that are Difficult for Humans?","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T07:59:32.638758Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2408.13257"},"observation_digest":"sha256:812863fb18477591fe4fa7ce8e89d2c45d26d21229e764a1eb83dcd59a25d0c4","observation_id":"2c0cffd4-9796-468c-9105-a91c41822bbc","resolution":{"observed_at":"2026-05-16T07:59:32.703331Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2412.05271","last_updated":"2025-09-26T12:52:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-06T18:57:08Z","title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","version":5},"reference_index":228,"source":"pdf_text","source_observed_at":"2026-05-10T13:23:57.588851Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2412.05271"},"observation_digest":"sha256:40bbf1bf51ec3edc0977ffbd63f7214a64df099121ecbbd86ad0df8d13c237a8","observation_id":"0bc929f0-7cd8-4d2c-a166-8b4f02b75fa7","resolution":{"observed_at":"2026-05-10T13:23:58.036152Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2502.04326","last_updated":"2026-03-01T04:35:41Z","snapshot_observed_at":"2026-07-06T20:32:23.502480Z","submitted_at":"2025-02-06T18:59:40Z","title":"WorldSense: Evaluating Real-world Omnimodal Understanding for Multimodal LLMs","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-17T05:53:26.066674Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2502.04326"},"observation_digest":"sha256:97d7987a9350e7cad39b7aa9c45b262f36a326a8b0e98fd9c5a71d48779bdf0b","observation_id":"38269d09-3bca-4cbd-8bb8-73503b83363f","resolution":{"observed_at":"2026-05-17T05:53:26.122658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:fcfb3cab8ccd6acb7e6e13738c62efdba55f74b7e3d927681c99cadf8f9c2e4b","observation_id":"61cd1887-8c50-4ebe-85e3-3ea3c9b7988c","resolution":{"observed_at":"2026-05-23T02:25:19.101037Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"reference_index":114,"source":"pdf_text","source_observed_at":"2026-05-10T13:41:07.991012Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2504.10479"},"observation_digest":"sha256:f91552b86cfea3b1e65107d83be6a2b424cbc28327531744f19dcbe822362fbd","observation_id":"b33f1460-4f7d-43ab-8b0d-7e224e99433d","resolution":{"observed_at":"2026-05-10T13:41:08.096968Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-06T18:19:58.185565Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08719","last_updated":"2025-07-11T16:19:53Z","snapshot_observed_at":"2026-08-06T18:08:36.402067Z","submitted_at":"2025-07-11T16:19:53Z","title":"Multilingual Multimodal Software Developer for Code Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-06T18:19:58.185565Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2507.08719"},"observation_digest":"sha256:31d99b1e72184fd0931f8634f089aaef523838b9484730de86a29a895ba7733c","observation_id":"03f0d185-6e7d-4775-a7bf-4f27119e219c","resolution":{"observed_at":"2026-08-06T18:19:58.185565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2508.18265","last_updated":"2025-08-27T14:39:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-25T17:58:17Z","title":"InternVL3.5: Advancing Open-Source Multimodal Models in Versatility, Reasoning, and Efficiency","version":2},"reference_index":119,"source":"pdf_text","source_observed_at":"2026-05-10T11:58:58.660564Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2508.18265"},"observation_digest":"sha256:829ed61d5fdd0693f58603c47e7c3e3ff33885ed5503e2408ca40fb944f5bb25","observation_id":"4ddae192-bd41-49eb-aed9-21f4a513d996","resolution":{"observed_at":"2026-05-10T11:58:58.775085Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2509.10026","last_updated":"2026-04-14T03:34:18Z","snapshot_observed_at":"2026-07-06T22:29:06.119014Z","submitted_at":"2025-09-12T07:45:44Z","title":"LaV-CoT: Language-Aware Visual CoT with Multi-Aspect Reward Optimization for Real-World Multilingual VQA","version":4},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-18T17:53:08.136677Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2509.10026"},"observation_digest":"sha256:24aa84644d73f0ad5eded7acdd920917ba34fa770779b77f40849cdc16659148","observation_id":"fa77b7a4-1134-4c0f-9ab0-63b9d36b2162","resolution":{"observed_at":"2026-05-18T17:56:42.310528Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2509.22123","last_updated":"2026-05-13T12:28:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-26T09:46:13Z","title":"Multilingual Vision-Language Models, A Survey","version":2},"reference_index":138,"source":"pdf_text","source_observed_at":"2026-05-18T13:02:08.000814Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2509.22123"},"observation_digest":"sha256:448b8e0c706897ba384dece3f5e30384d8925d6376d0c4f50beb9a1044aea168","observation_id":"34fb4af9-5580-4886-ad1e-d1a63464aaad","resolution":{"observed_at":"2026-05-18T13:02:37.275213Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-03T10:43:50.130815Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09118","last_updated":"2026-07-16T14:44:01Z","snapshot_observed_at":"2026-08-06T20:05:00.082163Z","submitted_at":"2026-01-14T03:35:09Z","title":"LPCAN: Lightweight Pyramid Cross-Attention Network for Rail Surface Defect Detection Using RGB-D Data","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:50.130815Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2601.09118"},"observation_digest":"sha256:e5735ad56b927ba74c35b071c260224543efafd75e39d9ad05e0fc8af57fbd64","observation_id":"9f3b2e45-ec2a-407a-b6f0-eaddc4eb220f","resolution":{"observed_at":"2026-08-03T10:43:50.130815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-03T10:43:42.114265Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.09238","last_updated":"2026-07-16T14:45:17Z","snapshot_observed_at":"2026-08-06T03:35:04.691296Z","submitted_at":"2026-01-14T07:21:57Z","title":"Knowledge-Embedded and Hypernetwork-Guided Few-Shot Substation Meter Defect Image Generation Method","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T10:43:42.114265Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2601.09238"},"observation_digest":"sha256:eeaad8a5cef4845a97b073cf5a4243bba814b2f8cc1529f04d674769c22e979f","observation_id":"111207c7-2583-48df-907a-babeb134fe9c","resolution":{"observed_at":"2026-08-03T10:43:42.114265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.03339","last_updated":"2026-04-03T07:59:26Z","snapshot_observed_at":"2026-07-06T22:52:34.609783Z","submitted_at":"2026-04-03T07:59:26Z","title":"Hierarchical Awareness Adapters with Hybrid Pyramid Feature Fusion for Dense Depth Prediction","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-13T20:01:57.029143Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.03339"},"observation_digest":"sha256:c90e61ad74139dfa311c54169290178f33827475711e61b3c81461e45f1aa8fc","observation_id":"cf8efb61-fa51-4edd-884f-b7ca1d56c4e0","resolution":{"observed_at":"2026-05-13T20:03:12.256459Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-10T05:11:00.461167Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:7e01257eb4e6356d486b4d6aef59214fc36f8b7d5d8a05937bc6c36cddc4dc29","observation_id":"cfb4d057-5666-4f78-a646-a46b32205dc3","resolution":{"observed_at":"2026-05-10T09:38:43.165665Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2604.18347","last_updated":"2026-06-05T18:16:54Z","snapshot_observed_at":"2026-07-06T23:05:13.178333Z","submitted_at":"2026-04-20T14:42:47Z","title":"Multilingual Training and Evaluation Resources for Vision-Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-05T12:25:00.027624Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2604.18347"},"observation_digest":"sha256:8008ec0d5a0d15492e3f2c61efcb2fc8acc60a92d8f352f058be99ba249d324a","observation_id":"d132e84b-6c28-4475-8e41-eb619ea4a887","resolution":{"observed_at":"2026-07-05T12:30:59.869841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2605.18173","last_updated":"2026-05-18T10:15:57Z","snapshot_observed_at":"2026-08-02T16:11:51.976692Z","submitted_at":"2026-05-18T10:15:57Z","title":"Do You Need Text Rectification? Soft Attention Mask Embedding for Rectification-Free Scene Text Spotting","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-20T11:28:51.711892Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2605.18173"},"observation_digest":"sha256:df47e8fd8e7508ea0f342dd894e3676f9880ebf8e5407000560cd2bc339ffb4a","observation_id":"ed168971-597e-4e1d-b4c1-736851e055d9","resolution":{"observed_at":"2026-05-20T11:33:14.576013Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering","version":5},"cited_work":{"arxiv_id":"2405.11985","doi":"10.48550/arxiv.2405.11985","metadata_source":"pith","pith_arxiv_id":"2405.11985","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mtvqa: Benchmarking multilingual text-centric visual question answering","venue":"cs.CV","work_id":"16708089-820b-4898-a73a-a876186f93ed","year":2024},"citing_paper":{"arxiv_id":"2606.30189","last_updated":"2026-06-29T12:04:01Z","snapshot_observed_at":"2026-07-07T00:04:05.275293Z","submitted_at":"2026-06-29T12:04:01Z","title":"DAIN: Dynamic Agent-Based Interaction Network for Efficient and Collaborative Multimodal Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T06:01:20.803078Z"},"links":{"cited_paper":"/paper/2405.11985","citing_paper":"/paper/2606.30189"},"observation_digest":"sha256:9b35c9065aa262b39840147d8bbc380a71a5a4d13f29f948f06c48691d62170d","observation_id":"f45e8b3e-a9b3-4e73-9033-66b690564a28","resolution":{"observed_at":"2026-06-30T06:04:21.359361Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2405.11985/citation-record","integrity":"/paper/2405.11985/integrity","json":"/paper/2405.11985/citation-record.json","paper":"/paper/2405.11985"},"outbound":[],"paper":{"arxiv_id":"2405.11985","last_updated":"2025-06-11T03:33:02Z","latest_version":5,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T23:54:42.155811Z","submitted_at":"2024-05-20T12:35:01Z","title":"MTVQA: Benchmarking Multilingual Text-Centric Visual Question Answering"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 16 inbound Pith citation observations for arXiv:2405.11985."}