{"as_of":"2026-08-15T02:28:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:010511cca9eb0e464c1a68280f77bad2501ce7a4ffabc4a7a20f31031b4612f0","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T10:36:36.109735Z","state":"measured"},{"denominator":55,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":55,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T15:23:53.069460Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T08:50:57.754355Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19103","snapshot_observed_at":"2026-08-05T15:23:53.069460Z","title":"arXiv preprint arXiv:2411.19103","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19944","last_updated":"2025-08-31T10:33:09Z","snapshot_observed_at":"2026-08-14T09:19:24.424350Z","submitted_at":"2025-08-27T15:01:02Z","title":"KRETA: A Benchmark for Korean Reading and Reasoning in Text-Rich VQA Attuned to Diverse Visual Contexts","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T15:23:53.069460Z"},"links":{"cited_paper":"/paper/2411.19103","citing_paper":"/paper/2508.19944"},"observation_digest":"sha256:04dff7b2ae65db7b02e8f27f747f12538c6690993b615618daa13e4c19e9c24e","observation_id":"42f4af09-c14f-415e-a1e6-575f581e615f","resolution":{"observed_at":"2026-08-05T15:23:53.069460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"cited_work":{"arxiv_id":"2411.19103","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.19103","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c83e50be-1b75-48c0-83d8-25fd91d755d5","year":2024},"citing_paper":{"arxiv_id":"2604.11490","last_updated":"2026-04-16T23:50:04Z","snapshot_observed_at":"2026-08-11T15:57:44.785010Z","submitted_at":"2026-04-13T13:56:00Z","title":"Anthropogenic Regional Adaptation in Multimodal Vision-Language Model","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-10T16:29:12.064221Z"},"links":{"cited_paper":"/paper/2411.19103","citing_paper":"/paper/2604.11490"},"observation_digest":"sha256:fdc1cf789c12d06894eec5eb26d0aa6032567ec442d6362928c00cffafa0fdf0","observation_id":"579ef28e-9638-4b05-bd0d-dbb1829f3b4d","resolution":{"observed_at":"2026-05-11T08:50:57.757159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2411.19103/citation-record","integrity":"/paper/2411.19103/integrity","json":"/paper/2411.19103/citation-record.json","paper":"/paper/2411.19103"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T10:36:35.852542Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.852542Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8c789ee5fa5a2ecc252f089f4bb29024ea85d0bd088175c673ff1f18c48da6b0","observation_id":"c3ec4983-b98b-4b07-bdfe-49a8bae6b79d","resolution":{"observed_at":"2026-08-12T10:36:35.852542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T10:36:35.858504Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.858504Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8f921d008c9c344254259c5a108cb1188077956c01e392c41dc4e91b3bc49e72","observation_id":"c7f4e65e-14c8-4085-9674-9268d6349542","resolution":{"observed_at":"2026-08-12T10:36:35.858504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07073","last_updated":"2024-10-10T17:59:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-09T17:16:22Z","title":"Pixtral 12B","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07073","snapshot_observed_at":"2026-08-12T10:36:35.864070Z","title":"Pixtral 12b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.864070Z"},"links":{"cited_paper":"/paper/2410.07073","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:d49ba095c075ef40b15b262a631eda165019d48fe131e52a72ad95c0e53fa3cc","observation_id":"c1e5ee41-0493-4459-a3d8-4db1ff6bf164","resolution":{"observed_at":"2026-08-12T10:36:35.864070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.869702Z","title":"Claude 3.5 sonnet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.869702Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:97e99d7f981feada0515b3be40860a0f9d701cfc9761ba6ca7b8b181744c9ca9","observation_id":"b93e74b5-54da-4b69-8c7c-7cd75a6814ba","resolution":{"observed_at":"2026-08-12T10:36:35.869702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.921422Z","title":"Are we on the right way for evaluating large vision-language models? In The Thirty-eighth Annual Conference on Neural Information Processing Systems, 2024","venue":null,"work_id":"278fb1eb-7902-42e8-a83c-448ab215f1c8","year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.873893Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:e56c5adbf9ac365b431109ec6cfa077dbe2ca70ac900e7de28704bccc8cc570d","observation_id":"3b116a9b-aaf5-4d76-9988-cf27460567a7","resolution":{"observed_at":"2026-08-12T10:36:36.927658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-12T10:36:35.879674Z","title":"How far are we to gpt-4v? closing the gap to commercial multimodal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.879674Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:31cf34d5593c97e33b7257dd745f8656fa1e3db342011178ebe2d75fb7268f4e","observation_id":"b16a62da-450e-4651-b93b-b9fed078a453","resolution":{"observed_at":"2026-08-12T10:36:35.879674Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-12T10:36:35.885630Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.885630Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:2685460e15bf5f529462db413ddf94d2e008ca7417bd340e5b0dde9b06e5cdc9","observation_id":"246d330c-3898-44fc-b5c1-fd9b8351ba9f","resolution":{"observed_at":"2026-08-12T10:36:35.885630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11691","last_updated":"2025-08-28T09:40:49Z","snapshot_observed_at":"2026-08-12T23:21:07.520817Z","submitted_at":"2024-07-16T13:06:15Z","title":"VLMEvalKit: An Open-Source Toolkit for Evaluating Large Multi-Modality Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11691","snapshot_observed_at":"2026-08-12T10:36:35.890601Z","title":"Vlmevalkit: An open-source toolkit for evaluating large multi-modality models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.890601Z"},"links":{"cited_paper":"/paper/2407.11691","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:d235b44cfb23ac2981096ab63611e7626f4140affe7272d94b774937f7999868","observation_id":"5714edc0-0fb7-401a-aa5b-ba5e6dfac8b5","resolution":{"observed_at":"2026-08-12T10:36:35.890601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.907638Z","title":"Pororo: Platform of neural models for natural language processing","venue":null,"work_id":"5fbb8a7b-9a40-4e3a-8e51-8efcf7a96ae1","year":2021},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.895328Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:18d7f5d332b02a03614897183d1780c734c7987f2e53d5b07e00fbb85c7b0450","observation_id":"51c57779-af72-41e5-8fee-5046260785c0","resolution":{"observed_at":"2026-08-12T10:36:36.912470Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.893318Z","title":"Icdar 2013 robust reading competition","venue":null,"work_id":"0869c512-2c43-465c-b199-3061802251c5","year":2013},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.899817Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8e9f57682cc1b777fe4be43a142b400f7850bb106448aa5dba0b57d1b6ac6861","observation_id":"c0b004ca-f92b-4cb4-a871-3eadd68f546f","resolution":{"observed_at":"2026-08-12T10:36:36.897869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.879738Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"8b917e51-d938-4277-97d9-33142e4bd3f7","year":2015},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.904048Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:e7f82902a2293374cdffa4b204c00bfc82dbb3371b3799becf4662c38f418ed9","observation_id":"d1372440-1e8f-4eac-8b8a-cbe10f98cbec","resolution":{"observed_at":"2026-08-12T10:36:36.884238Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.865650Z","title":"Ocr-free document understanding transformer","venue":null,"work_id":"17acc4ab-76c0-4cd0-8587-5c1916479234","year":2022},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.908719Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:f47f65219f3999c65273a32b54ed4f91ba37bb796e3473f0d86c0cc08edf454c","observation_id":"51682c5f-09ce-42e3-ac5a-701740ba3fe5","resolution":{"observed_at":"2026-08-12T10:36:36.870270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.851619Z","title":"Korean Localization of Visual Question Answering for Blind People","venue":null,"work_id":"8f0428ff-eac6-4075-9f8e-922adfc4ca3a","year":2019},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.913040Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8fdf3165ac2a20125d4e8b0b45c69c75b7502c943a5cb165676aad95945b7987","observation_id":"ef31c4a8-ef05-48a1-ab75-b25a673efd42","resolution":{"observed_at":"2026-08-12T10:36:36.856356Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12637","last_updated":"2024-08-22T17:47:24Z","snapshot_observed_at":"2026-08-12T22:59:05.910546Z","submitted_at":"2024-08-22T17:47:24Z","title":"Building and better understanding vision-language models: insights and future directions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12637","snapshot_observed_at":"2026-08-12T10:36:35.917708Z","title":"Building and bet- ter understanding vision-language models: insights and future directions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.917708Z"},"links":{"cited_paper":"/paper/2408.12637","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:709303c0d218253217c165192341d1217a8b3efb91d9173a3b8f223e2be9d0c1","observation_id":"e481b500-b1fb-47f6-a568-685b8dc5b950","resolution":{"observed_at":"2026-08-12T10:36:35.917708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.837416Z","title":"Popeval: A character-level approach to end-to-end evaluation compatible with word-level benchmark dataset","venue":null,"work_id":"806e47a2-6ecc-4e4b-93b1-dd9d27f615c4","year":2019},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.922716Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:bd30304b0b6565b7f28ff16535da65184e442e3b0bae7456f60a7717cfa2a688","observation_id":"eb303d3c-5e48-4e5f-9f4b-e34c74bfd650","resolution":{"observed_at":"2026-08-12T10:36:36.843146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03326","last_updated":"2024-10-26T16:35:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:59:44Z","title":"LLaVA-OneVision: Easy Visual Task Transfer","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03326","snapshot_observed_at":"2026-08-12T10:36:35.927460Z","title":"Llava-onevision: Easy visual task transfer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.927460Z"},"links":{"cited_paper":"/paper/2408.03326","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:6bbc00c3fbb720daa5de341e69bec938998c7c18b170817bb949b1f0e4face2e","observation_id":"eb77d461-959f-4b92-896c-53fd31b8bfbf","resolution":{"observed_at":"2026-08-12T10:36:35.927460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.932104Z","title":"Seed-bench: Benchmarking multimodal large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.932104Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8ce96f24686a41523f95378a7d7a5c88f5dbf5c70ae8c6a0e9fb690e7f7e14dd","observation_id":"17dbb9ee-fe15-4080-aa48-7c3b080ca89e","resolution":{"observed_at":"2026-08-12T10:36:35.932104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07895","last_updated":"2024-07-28T19:58:08Z","snapshot_observed_at":"2026-08-13T00:09:23.835117Z","submitted_at":"2024-07-10T17:59:43Z","title":"LLaVA-NeXT-Interleave: Tackling Multi-image, Video, and 3D in Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07895","snapshot_observed_at":"2026-08-12T10:36:35.936853Z","title":"Llava-next-interleave: Tackling multi-image, video, and 3d in large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.936853Z"},"links":{"cited_paper":"/paper/2407.07895","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:49a14585ee7ed74a0f4ae7e84e3002347d94d7c0429a6f4d1077ea5c19d174c6","observation_id":"67f14028-ed47-4e08-9371-ad03019cda90","resolution":{"observed_at":"2026-08-12T10:36:35.936853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08632","last_updated":"2024-09-06T11:20:13Z","snapshot_observed_at":"2026-08-14T10:12:58.959257Z","submitted_at":"2024-08-16T09:52:02Z","title":"A Survey on Benchmarks of Multimodal Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08632","snapshot_observed_at":"2026-08-12T10:36:35.943050Z","title":"A survey on benchmarks of multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.943050Z"},"links":{"cited_paper":"/paper/2408.08632","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:c7779d470dfc8ad767801c2cd6253fe6ddfbea0805388d148cf8ed2627ea013f","observation_id":"8fbd28c9-3f04-4a69-a00d-4c74e4a7748e","resolution":{"observed_at":"2026-08-12T10:36:35.943050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.948507Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.948507Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:56e8dce0036c5f3f0c40dc862cfe35596d005c86a57120b118966d16e093b761","observation_id":"16a8dd29-5225-48db-94d6-791e9927e454","resolution":{"observed_at":"2026-08-12T10:36:35.948507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.952362Z","title":"Visual instruction tuning.Advances in neural information processing systems , 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.952362Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:99cd520489245ce61c3e2d86e786685c25056a8c71e04c11e79105b2ddf7e2ef","observation_id":"e9b90bd9-b359-4b8f-b787-b79dee9b7014","resolution":{"observed_at":"2026-08-12T10:36:35.952362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.956783Z","title":"Mmbench: Is your multi-modal model an all-around player? In European Conference on Computer Vision, pages 216–233","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.956783Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:3eeabbdfb55dc565a664508c5d982963cdbd53657d2e475a12a4708680051ca4","observation_id":"9a7b7c2d-3b38-464d-a53e-41b2259a319a","resolution":{"observed_at":"2026-08-12T10:36:35.956783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-08-13T22:21:37.032118Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.07895","snapshot_observed_at":"2026-08-12T10:36:35.961256Z","title":"On the hidden mystery of ocr in large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.961256Z"},"links":{"cited_paper":"/paper/2305.07895","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:d4db0f5c60cb075b983051b4716ffbeebf465069d02a716a8ac9b2202c576923","observation_id":"644ef2d0-4c4f-46d9-9072-4f75b800ab02","resolution":{"observed_at":"2026-08-12T10:36:35.961256Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-11T01:38:59.827005Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-12T10:36:35.966053Z","title":"Deepseek-vl: towards real-world vision-language under- standing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.966053Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:e5f01cae3159b5dd2c564c70a8baf80a3ab5fa0828c0b24f567074673853675e","observation_id":"62577d7d-b611-4861-a10a-b66b17ba5381","resolution":{"observed_at":"2026-08-12T10:36:35.966053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03003","last_updated":"2024-03-05T14:31:24Z","snapshot_observed_at":"2026-08-15T01:58:37.525169Z","submitted_at":"2024-03-05T14:31:24Z","title":"Feast Your Eyes: Mixture-of-Resolution Adaptation for Multimodal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03003","snapshot_observed_at":"2026-08-12T10:36:35.970570Z","title":"Feast your eyes: Mixture-of-resolution adaptation for multimodal large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.970570Z"},"links":{"cited_paper":"/paper/2403.03003","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:dda7b11f3e25cdce06beae7b9fa0437388bb4bf6a7d04fa742aa048d889d0b4f","observation_id":"a482db7a-3c49-4dcf-a98d-b55608b817c6","resolution":{"observed_at":"2026-08-12T10:36:35.970570Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.788805Z","title":"Cord: A consolidated receipt dataset for post-ocr parsing","venue":null,"work_id":"3a506e1f-0f64-4f6a-af12-cfc53d6e777e","year":2019},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.974921Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:c5690b16f7aa46cbb8dd6070cbd535b46983dd83c9443921561248c673916d1f","observation_id":"c061e2c0-08c5-49dc-b3f4-024b4b23566d","resolution":{"observed_at":"2026-08-12T10:36:36.793542Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-08-12T12:24:23.815073Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-12T10:36:35.979973Z","title":"Kosmos-2: Grounding multimodal large language models to the world, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.979973Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:cf178b8dec7d52f5fe30af3cfa1dba1ad6aa0d351c30fc4d14e23632ffc4391d","observation_id":"da1c4e4a-caa6-43f2-8733-0d84693ad957","resolution":{"observed_at":"2026-08-12T10:36:35.979973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.985077Z","title":"Direct preference optimization: Your language model is secretly a reward model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.985077Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:0bb70462499ee3d0f296665fd2f41f5672dde09f91f86f86b5d4acb5fe3c7a96","observation_id":"f7e29a92-e734-4ce7-a87b-d385a2a9644f","resolution":{"observed_at":"2026-08-12T10:36:35.985077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.990115Z","title":"Exaone 3.0 7.8 b instruction tuned language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.990115Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:ddc70dbf97ae79cff16e86c24eea331b975d760fc38ccd4a0b1cc87c74edb7f1","observation_id":"604c59d3-a8fe-4a00-b43c-68248d20f7d1","resolution":{"observed_at":"2026-08-12T10:36:35.990115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:35.995460Z","title":"X-LLaV A: Optimizing bilingual large vision-language alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:35.995460Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:5b14ba974e01b54f2726fe4e590c648d951414fa23e2001330eb2f3ed57bc803","observation_id":"b23c4022-859d-42bf-b0fa-541cbf73ec0c","resolution":{"observed_at":"2026-08-12T10:36:35.995460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-12T10:36:36.001932Z","title":"Gemini: a family of highly capable multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.001932Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:341f5e555370d17d425f1da8eba228188d74ad1e5639d4a4895d26dc17527ab4","observation_id":"19ec7602-0137-4c88-a501-a41b2eee73c8","resolution":{"observed_at":"2026-08-12T10:36:36.001932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.006796Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.006796Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:12c146db5e77ecfd3eb052ed2b2609166aa76784b634a88838b80b32730e9ff2","observation_id":"452c9471-7122-4496-a1f6-8cb1ff36ffa1","resolution":{"observed_at":"2026-08-12T10:36:36.006796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-12T10:36:36.010906Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.010906Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:bd0ac17e419041de3b8771b905beb08f3c872a009dc7e6b5b9545809347a792c","observation_id":"8db81b3a-4c41-42d0-a111-7d3770ee2e35","resolution":{"observed_at":"2026-08-12T10:36:36.010906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-12T10:36:36.015486Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.015486Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:a69fff523641f90ff69693c1f15c54df717ae0b6f6ad0a3e3038ef4aa72b685a","observation_id":"3545269b-b6bc-4f4c-9c61-60214502c22f","resolution":{"observed_at":"2026-08-12T10:36:36.015486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.020089Z","title":"Mmmu: A massive multi-discipline multimodal understanding and reasoning benchmark for expert agi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.020089Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:f47f1ce035122e3a2ebae321f343f59252dffedd91e18409a3e040a3e08a335e","observation_id":"8960d159-d36d-4147-9bed-865e5c3489f0","resolution":{"observed_at":"2026-08-12T10:36:36.020089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.16153","last_updated":"2025-01-26T15:34:59Z","snapshot_observed_at":"2026-08-12T22:59:25.550697Z","submitted_at":"2024-10-21T16:19:41Z","title":"Pangea: A Fully Open Multilingual Multimodal LLM for 39 Languages","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.16153","snapshot_observed_at":"2026-08-12T10:36:36.025075Z","title":"Pangea: A fully open multilingual multimodal llm for 39 languages","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.025075Z"},"links":{"cited_paper":"/paper/2410.16153","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:1e2ac8db8d88ff1b12bfa10c9066634e4fce9859d406fd856f3468c2a7f7985b","observation_id":"5befc4bb-fea9-4a40-bb2a-3c5767bb97a3","resolution":{"observed_at":"2026-08-12T10:36:36.025075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.029653Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.029653Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:53b84422dfcda4f5635ca44db77c8105e3243eb487b2f14c9c51f0a046fcbc83","observation_id":"2f56c486-75f2-45ef-b34e-0104b5948ad0","resolution":{"observed_at":"2026-08-12T10:36:36.029653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12772","last_updated":"2025-05-05T04:48:45Z","snapshot_observed_at":"2026-08-14T07:51:18.307451Z","submitted_at":"2024-07-17T17:51:53Z","title":"LMMs-Eval: Reality Check on the Evaluation of Large Multimodal Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12772","snapshot_observed_at":"2026-08-12T10:36:36.033894Z","title":"Lmms-eval: Reality check on the evaluation of large multimodal models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.033894Z"},"links":{"cited_paper":"/paper/2407.12772","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:729dbc2a1a0f460fe6f96b9a01e98098bbd0ef2f397315ab7db060e1ceb096ab","observation_id":"adab2f40-cc40-44f4-8c01-717e2f6e1b60","resolution":{"observed_at":"2026-08-12T10:36:36.033894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.741499Z","title":"Swift:a scal- able lightweight infrastructure for fine-tuning, 2024","venue":null,"work_id":"f1f6a4a1-2a33-4225-ab7a-032cc0212e11","year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.039180Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:a3ba3041603a76439740bd7d0df8eca4fd7e298baef9f29ca4ef0eee5094b568","observation_id":"8f6afc56-4097-454a-9150-3fc39708ad0f","resolution":{"observed_at":"2026-08-12T10:36:36.748316Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.044493Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.044493Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:7905a7af271ae4fa9aa4313d1723b54873fa0dee0e104e40ed19c70202f18407","observation_id":"80e390e2-b100-4c33-a098-68045181a8b3","resolution":{"observed_at":"2026-08-12T10:36:36.044493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13372","last_updated":"2024-06-27T22:44:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-20T08:08:54Z","title":"LlamaFactory: Unified Efficient Fine-Tuning of 100+ Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13372","snapshot_observed_at":"2026-08-12T10:36:36.049341Z","title":"축구” (soccer) and “미식축구","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.049341Z"},"links":{"cited_paper":"/paper/2403.13372","citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:7721809fc69b7bc459545321bfbc8667faec81075a8adae89c9e96f4cb55988a","observation_id":"139285f2-244a-45bd-973c-d4c7a734478c","resolution":{"observed_at":"2026-08-12T10:36:36.049341Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.714798Z","title":null,"venue":null,"work_id":"c80bf80e-6ab3-48b7-813f-39ca1e701595","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.054202Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:a0f9093d5b965cdaeac2c65f08fc2fe94882b57d33f4a74dc586a88d1efaa271","observation_id":"809f3286-352b-42bf-9f2c-9a5b7840e845","resolution":{"observed_at":"2026-08-12T10:36:36.719589Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.701189Z","title":null,"venue":null,"work_id":"ff6871e3-b8c6-4413-a4ff-1ba9efab3492","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.059447Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:6226546843d2df9094a80fb726f5bc34acedee0f92bded8dd32f260d2b4f68f0","observation_id":"fcd469a4-f479-4bf2-a266-66771f85addc","resolution":{"observed_at":"2026-08-12T10:36:36.705504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.686865Z","title":null,"venue":null,"work_id":"88b25a2c-ec3c-4516-a0b2-130019c91dc7","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.065506Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:afe18df3780bdd7820ea5b736efbe061ea33d97c73d6764525aa93ca653b7379","observation_id":"4af0a18f-ab65-4411-9732-09c638dc520c","resolution":{"observed_at":"2026-08-12T10:36:36.691332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.671793Z","title":"# 출력 형식 - 첫 번째 줄: `어시스턴트1_점수 어시스턴트2_점수` (예: `8 9`) - 두 번째 줄: `유용성`, `관련성`, `정확성`, `세부 수준`, `한국어 생성능력` 기준으로 점수를 설명 하는 자세한 문단을 제공합니다","venue":null,"work_id":"ebad8bda-c9d1-40be-be97-5ad97fe50ee8","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.069989Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:26515801bc0ba6f7e75a05e00d00bdf671e03b0d35a9912c77054c915ddf6df9","observation_id":"3a37a793-b66e-49fa-b975-b201fe16a6bd","resolution":{"observed_at":"2026-08-12T10:36:36.676764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.659016Z","title":null,"venue":null,"work_id":"ca3ac2fd-4aff-4be5-b615-a71ac1c3f326","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.076612Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:02840d0c56b77b014c32601d9d564d31aef504e3ce72c97a782b110be5e1a1c7","observation_id":"9e90c8ed-c6c5-420f-97fe-23b5148bdec5","resolution":{"observed_at":"2026-08-12T10:36:36.663376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.645224Z","title":null,"venue":null,"work_id":"24618350-8352-4c86-9f84-3fc4ed373392","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.080778Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:60638be671ec7032b093a4164355a491574a80034938ffdc9c8776cf1df5177e","observation_id":"8c43a167-2fae-459b-9913-4bb7fe9235a8","resolution":{"observed_at":"2026-08-12T10:36:36.650092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.626843Z","title":null,"venue":null,"work_id":"5e5eaee9-4519-4cd6-b427-a482946332a4","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.085491Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:72b1db56644055ad1712c86c5e1a421858dedf578599c151d2797f936d923b56","observation_id":"5c19e8b7-c018-4eb3-bb3b-fc4f50a87db1","resolution":{"observed_at":"2026-08-12T10:36:36.631921Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.610069Z","title":null,"venue":null,"work_id":"77a4972a-7d9a-4b26-9bd8-886ec974bfc1","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.089879Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:e0a2a84bb07da7bb7c44d1ae563012bc444ed322de0035a34c1ad387e1577960","observation_id":"bc7c32ca-e971-4795-8d4d-38402f0f4955","resolution":{"observed_at":"2026-08-12T10:36:36.615033Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.597356Z","title":null,"venue":null,"work_id":"357113cd-903f-4b29-b9ef-bd3e28e3c10c","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.094275Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:8b483f12b94dac86e3f8bd0aba16ac9bd4c7c6376076859cedf176facbe36e69","observation_id":"36ebed22-f097-4b91-93c6-d375de28c098","resolution":{"observed_at":"2026-08-12T10:36:36.601697Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.584901Z","title":null,"venue":null,"work_id":"f1cb90c5-385f-4222-9b6a-ff2a05233c91","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.099332Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:679937395fe9b3e2186585e253e64bf82d0ce1e90e6aa726c57c0024507664f5","observation_id":"51633135-2074-408c-9ef9-6e88c3558468","resolution":{"observed_at":"2026-08-12T10:36:36.588969Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.572060Z","title":null,"venue":null,"work_id":"46aff5c3-909c-4116-a5ab-1522fdddef50","year":null},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.104063Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:2afdf39b5f0e24a50643e49a776e9df50b22be0467fb7bfffc5d2eb01b78b388","observation_id":"21d48145-90f6-48b4-8569-dd08c1d97009","resolution":{"observed_at":"2026-08-12T10:36:36.576150Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T10:36:36.558984Z","title":"STARBUCKS","venue":null,"work_id":"152cc437-5884-452e-982b-bc5c3295d04c","year":2025},"citing_paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T10:36:36.109735Z"},"links":{"citing_paper":"/paper/2411.19103"},"observation_digest":"sha256:30d76934ab0e33eb11990ea419320b163c1a2790b121f3a37c5ce77637f0d71c","observation_id":"a2bd0708-bf91-4878-b984-d136dd20162c","resolution":{"observed_at":"2026-08-12T10:36:36.563962Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.19103","last_updated":"2024-11-28T12:38:42Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-13T22:22:44.895942Z","submitted_at":"2024-11-28T12:38:42Z","title":"VARCO-VISION: Expanding Frontiers in Korean Vision-Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 2 inbound Pith citation observations for arXiv:2411.19103."}