{"as_of":"2026-08-19T18:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7f461c2148d08d658e27d9f9f31b5c7c7016573e745f33b41aa29f3357d8c5f0","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:23:54.203192Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.19944/citation-record","integrity":"/paper/2508.19944/integrity","json":"/paper/2508.19944/citation-record.json","paper":"/paper/2508.19944"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2407.06023","last_updated":"2024-07-24T18:40:36Z","snapshot_observed_at":"2026-08-17T02:05:35.367393Z","submitted_at":"2024-07-08T15:17:46Z","title":"Distilling System 2 into System 1","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06023","snapshot_observed_at":"2026-08-05T15:23:54.147498Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:54.147498Z"},"links":{"cited_paper":"/paper/2407.06023","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:17c6cd8fd3c618f8a7c8aab070c2628854f0cf619b1dfeae05b3e33bc4b92faf","observation_id":"a7834192-50b9-4a2c-a1b0-fab71059e897","resolution":{"observed_at":"2026-08-05T15:23:54.147498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16469","last_updated":"2025-05-30T05:58:03Z","snapshot_observed_at":"2026-08-16T13:40:13.088892Z","submitted_at":"2024-06-24T09:18:15Z","title":"Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration","version":3},"cited_work":{"arxiv_id":"2406.16469","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.16469","snapshot_observed_at":"2026-08-05T15:23:54.812587Z","title":"Evaluating Visual and Cultural Interpretation: The K-Viscuit Benchmark with Human-VLM Collaboration","venue":"cs.CL","work_id":"c6122993-7a9d-4240-9d59-e482e7174edd","year":2024},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.390750Z"},"links":{"cited_paper":"/paper/2406.16469","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:b04e1e3362377d7f10bb9bce9a0ac4457761943f169673a5bbecbea6f906d577","observation_id":"332a2505-24d6-4798-b43d-9f2c31962986","resolution":{"observed_at":"2026-08-05T15:23:54.843244Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:23:55.522866Z","title":"target-language in- structions for multilingual LLMs","venue":null,"work_id":"d295227d-dacf-4210-ba12-43f98a151f02","year":2025},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.635515Z"},"links":{"citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:b67b28773b9108da8eb133c92341fffecd3d562a4cedbbea33812a1effe3c57f","observation_id":"562a8238-04d2-4831-b6c0-67ea53962bb3","resolution":{"observed_at":"2026-08-05T15:23:55.619383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05707","last_updated":"2024-10-10T15:12:23Z","snapshot_observed_at":"2026-08-16T13:44:48.894987Z","submitted_at":"2024-06-09T09:51:55Z","title":"QGEval: Benchmarking Multi-dimensional Evaluation for Question Generation","version":2},"cited_work":{"arxiv_id":"2406.05707","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.05707","snapshot_observed_at":"2026-08-05T15:23:54.683953Z","title":"QGEval: Benchmarking Multi-dimensional Evaluation for Question Generation","venue":"cs.CL","work_id":"9a37d7ee-80ba-42a2-823f-25e20ae79268","year":2024},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.739805Z"},"links":{"cited_paper":"/paper/2406.05707","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:24b38163003dd65bd863a4882ff706fa3eabe34ca46f66bc9ec47d4c4c6ba782","observation_id":"f00b02e9-d38b-42fe-8d8d-75f5b9d9d396","resolution":{"observed_at":"2026-08-05T15:23:54.730802Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05444","last_updated":"2025-01-09T18:55:52Z","snapshot_observed_at":"2026-08-18T04:15:44.692958Z","submitted_at":"2025-01-09T18:55:52Z","title":"Can MLLMs Reason in Multimodality? EMMA: An Enhanced MultiModal ReAsoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.05444","snapshot_observed_at":"2026-08-05T15:23:52.822183Z","title":"arXiv preprint arXiv:2501.05444","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.822183Z"},"links":{"cited_paper":"/paper/2501.05444","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:8545cb54774d8fe8bd224990ae12d47150b5f434f77a89d42adaa19dbe3a0c59","observation_id":"f86f6a0d-31ae-4ba1-9bb2-869119a11ede","resolution":{"observed_at":"2026-08-05T15:23:52.822183Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-18T01:37:50.499305Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19103","snapshot_observed_at":"2026-08-05T15:23:53.069460Z","title":"arXiv preprint arXiv:2411.19103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.069460Z"},"links":{"cited_paper":"/paper/2411.19103","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:40dcab02b8f220db1ef728c1a036d32af9bf429f0dc279eea668dd0bd892ae58","observation_id":"42f4af09-c14f-415e-a1e6-575f581e615f","resolution":{"observed_at":"2026-08-05T15:23:53.069460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23730","last_updated":"2025-03-31T05:04:25Z","snapshot_observed_at":"2026-08-18T17:10:41.353186Z","submitted_at":"2025-03-31T05:04:25Z","title":"KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language","version":1},"cited_work":{"arxiv_id":"2503.23730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2503.23730","snapshot_observed_at":"2026-08-05T15:23:54.536474Z","title":"KOFFVQA: An Objectively Evaluated Free-form VQA Benchmark for Large Vision-Language Models in the Korean Language","venue":"cs.CV","work_id":"8bd02361-832b-42c6-aa94-700cfd1119da","year":2025},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.207102Z"},"links":{"cited_paper":"/paper/2503.23730","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:e55cc6f8c61aa033e79c1acd6b851588296b1f41a6e328ad25183348e1017220","observation_id":"ba2e8402-f650-4103-be53-4d5e95c4e695","resolution":{"observed_at":"2026-08-05T15:23:54.587026Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-08-18T11:56:50.710310Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-05T15:23:53.312371Z","title":"arXiv preprint arXiv:2408.03326","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.312371Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:93ae7341ea6b6ccfc3db3e7b75ae120ae407308811450c1d35b39a9a704a8890","observation_id":"afef7787-2222-4467-83d4-49502986deca","resolution":{"observed_at":"2026-08-05T15:23:53.312371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20797","last_updated":"2024-06-17T17:51:50Z","snapshot_observed_at":"2026-08-16T13:47:26.506119Z","submitted_at":"2024-05-31T13:59:18Z","title":"Ovis: Structural Embedding Alignment for Multimodal Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20797","snapshot_observed_at":"2026-08-05T15:23:53.395808Z","title":"arXiv preprint arXiv:2405.20797","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.395808Z"},"links":{"cited_paper":"/paper/2405.20797","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:5c4626789b6560636857960b9ba1fd35bceae7c69666b84ba3611ceeaf9fb79b","observation_id":"adb73585-05b2-45da-8192-0ca009ca97cf","resolution":{"observed_at":"2026-08-05T15:23:53.395808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-08-11T03:45:43.920485Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-05T15:23:53.484435Z","title":"arXiv preprint arXiv:2203.10244","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.484435Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:c859d93b77e8ad79040a23c0f81b8a26a583ef2138a26f041d1e7e50dec63584","observation_id":"d20a17e8-5e5a-480f-b5e7-34c77897b53b","resolution":{"observed_at":"2026-08-05T15:23:53.484435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:23:55.184622Z","title":"In Findings of the Association for Computational Linguistics: ACL 2022 , pages 2497–","venue":null,"work_id":"eeeb496c-7b76-4db5-b4a3-823294c6e99d","year":2022},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.649279Z"},"links":{"citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:ee5f286414eb33e1c1afbcdde1ee577eeb2c2969d70503da4aed0ac1073b74da","observation_id":"3987501e-c357-48f3-a73e-e59064896d08","resolution":{"observed_at":"2026-08-05T15:23:55.266273Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.02539","last_updated":"2025-05-26T03:47:46Z","snapshot_observed_at":"2026-08-16T13:46:10.029558Z","submitted_at":"2024-06-04T17:56:28Z","title":"Parrot: Multilingual Visual Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.02539","snapshot_observed_at":"2026-08-05T15:23:53.733257Z","title":"arXiv preprint arXiv:2406.02539","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.733257Z"},"links":{"cited_paper":"/paper/2406.02539","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:e87967b53391fa84c133bc7edb4e8f09d92db988d54a8f08a7f67f9cb08fb45d","observation_id":"f73cfec0-2720-4807-9af4-74bc2f9b15f9","resolution":{"observed_at":"2026-08-05T15:23:53.733257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.06730","last_updated":"2022-09-14T15:37:56Z","snapshot_observed_at":"2026-08-16T16:32:32.403752Z","submitted_at":"2022-09-14T15:37:56Z","title":"MUST-VQA: MUltilingual Scene-text VQA","version":1},"cited_work":{"arxiv_id":"2209.06730","doi":null,"metadata_source":"pith","pith_arxiv_id":"2209.06730","snapshot_observed_at":"2026-08-05T15:23:54.317570Z","title":"MUST-VQA: MUltilingual Scene-text VQA","venue":"cs.CV","work_id":"b9cca80a-a5f2-491a-8cd9-b76dad5fd926","year":2022},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.836153Z"},"links":{"cited_paper":"/paper/2209.06730","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:2c8d82dc9e68f0f887a1445756f073b96f3e485a953ce6083b683de415314dc6","observation_id":"3a81e72e-319b-4f15-86f8-1740168afd13","resolution":{"observed_at":"2026-08-05T15:23:54.395283Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-05T15:23:53.923746Z","title":"arXiv preprint arXiv:2409.12191","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.923746Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:a4e886c7219b4b4f16bfc91c719da99c2f6ffd6d1c505b9af943e9fa47f5cbea","observation_id":"c492fa4c-5f08-4133-8496-7f968711638b","resolution":{"observed_at":"2026-08-05T15:23:53.923746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.10302","last_updated":"2024-12-13T17:37:48Z","snapshot_observed_at":"2026-08-07T03:01:29.031129Z","submitted_at":"2024-12-13T17:37:48Z","title":"DeepSeek-VL2: Mixture-of-Experts Vision-Language Models for Advanced Multimodal Understanding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.10302","snapshot_observed_at":"2026-08-05T15:23:54.018200Z","title":"arXiv preprint arXiv:2412.10302","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:54.018200Z"},"links":{"cited_paper":"/paper/2412.10302","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:ea6f4a7411e4ed3ff413b22fb9b7599ed40b2e8c148fbefbb2e9231d3b3dbaf7","observation_id":"6546014c-ec27-47c5-b35f-4c61ae4e52bf","resolution":{"observed_at":"2026-08-05T15:23:54.018200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-05T15:23:54.087145Z","title":"arXiv preprint arXiv:2408.01800","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:54.087145Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:67884022d90e6a1463c62b3f2247255a227bdd642deb14bb7d2d4ab7e753e602","observation_id":"ee559cbe-d8a1-40b9-afcc-1aefb63e9d0f","resolution":{"observed_at":"2026-08-05T15:23:54.087145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:23:54.944390Z","title":null,"venue":null,"work_id":"f095b76f-4a05-425b-a9db-e2fa03e7c4b4","year":2025},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:54.203192Z"},"links":{"citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:1490400251333f5092b1d4a30828d3da9d61de4e6436bb00f0676fdfb2f3d6b9","observation_id":"de6250fe-b1c2-463e-b2d0-349481c18986","resolution":{"observed_at":"2026-08-05T15:23:55.051104Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.08199","last_updated":"2025-02-09T21:09:17Z","snapshot_observed_at":"2026-08-16T16:31:54.069794Z","submitted_at":"2022-09-16T23:49:00Z","title":"ScreenQA: Large-Scale Question-Answer Pairs over Mobile App Screenshots","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.08199","snapshot_observed_at":"2026-08-05T15:23:52.935815Z","title":"arXiv preprint arXiv:2209.08199","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.935815Z"},"links":{"cited_paper":"/paper/2209.08199","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:ffe2afda3d31b9b1ef4499a78858dec85d97cfe3eecfed024ddfca3e76a0e267","observation_id":"d1a26ad7-6b7d-4a65-8591-e0701589cbe3","resolution":{"observed_at":"2026-08-05T15:23:52.935815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T15:23:55.342313Z","title":"In Proceedings of ACL","venue":null,"work_id":"84a47ddc-7ac3-496d-8be5-ecd55de4b741","year":2024},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.538099Z"},"links":{"citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:60ee67a1d8a434c6e348565e71938ea4182687e953ffce5340dc7c01b9d8212e","observation_id":"5d9d3a6a-90e8-4631-96a9-f0f8dbe03073","resolution":{"observed_at":"2026-08-05T15:23:55.427249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-05T15:23:52.283285Z","title":"arXiv preprint arXiv:2404.14219","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.283285Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:b2dc729801b0af48194023d6112fa942a99f3eef2e1ff7f227a1d9b69c7ee15e","observation_id":"cd2966e3-c467-46af-80c3-6a334040aac3","resolution":{"observed_at":"2026-08-05T15:23:52.283285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T15:23:52.538063Z","title":"arXiv preprint arXiv:2502.13923","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:52.538063Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:2111526ba893b45bb853bea494e9a592bacd0f476c5969bdeebd77d789c45433","observation_id":"5cda32ee-1c9f-4d96-b821-c1e6a60c4538","resolution":{"observed_at":"2026-08-05T15:23:52.538063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","latest_version":2,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-16T05:16:07.000189Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2508.19944."}