{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:DEFGPQK45KD4DLHQOH5ZDMILGZ","short_pith_number":"pith:DEFGPQK4","schema_version":"1.0","canonical_sha256":"190a67c15cea87c1acf071fb91b10b36580c9e265804c934745ff3a0a396d476","source":{"kind":"arxiv","id":"2604.02048","version":2},"attestation_state":"computed","paper":{"title":"Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Daisuke Kawahara, Issa Sugiura, Keisuke Nakao, Keito Sasagawa, Koki Maeda, Naoaki Okazaki, Ryoko Tokuhisa, Shuhei Kurita, Yusuke Oda, Zhishen Yang, Ziqi Yin","submitted_at":"2026-04-02T13:48:43Z","abstract_excerpt":"Developing vision-language models (VLMs) that generalize across diverse tasks requires large-scale training datasets with diverse content. In English, such datasets are typically constructed by aggregating and curating numerous existing visual question answering (VQA) resources. However, this strategy does not readily extend to other languages, where VQA datasets remain limited in both scale and domain coverage. In this work, we introduce Jagle, the largest Japanese multimodal post-training dataset to date, comprising approximately 9.2 million instances across diverse tasks. Rather than relyin"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2604.02048","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2026-04-02T13:48:43Z","cross_cats_sorted":[],"title_canon_sha256":"b005a00eaa0c9b6810353d8c8acf333648836eebd18d12e1a1671168532daeea","abstract_canon_sha256":"a8ed97457396c3ed458f9b365dbc1c75219d6c81ac3c4a3ef1e4ca5e2862cb12"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-08-11T01:17:08.504155Z","signature_b64":"ZaJnOoF7OeFWwRqW3HF9jL125vACiQPKXl/2Wn4lVjocD2fkk3Rr2hjtcl4nqTqsRbFiAg5e9tYr0/yzGwH7BQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"190a67c15cea87c1acf071fb91b10b36580c9e265804c934745ff3a0a396d476","last_reissued_at":"2026-08-11T01:17:08.501555Z","signature_status":"signed_v1","first_computed_at":"2026-08-11T01:17:08.501555Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Jagle: Building a Large-Scale Japanese Multimodal Post-Training Dataset for Vision-Language Models","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Daisuke Kawahara, Issa Sugiura, Keisuke Nakao, Keito Sasagawa, Koki Maeda, Naoaki Okazaki, Ryoko Tokuhisa, Shuhei Kurita, Yusuke Oda, Zhishen Yang, Ziqi Yin","submitted_at":"2026-04-02T13:48:43Z","abstract_excerpt":"Developing vision-language models (VLMs) that generalize across diverse tasks requires large-scale training datasets with diverse content. In English, such datasets are typically constructed by aggregating and curating numerous existing visual question answering (VQA) resources. However, this strategy does not readily extend to other languages, where VQA datasets remain limited in both scale and domain coverage. In this work, we introduce Jagle, the largest Japanese multimodal post-training dataset to date, comprising approximately 9.2 million instances across diverse tasks. Rather than relyin"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2604.02048","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2604.02048/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2604.02048","created_at":"2026-08-11T01:17:08.502280+00:00"},{"alias_kind":"arxiv_version","alias_value":"2604.02048v2","created_at":"2026-08-11T01:17:08.502280+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2604.02048","created_at":"2026-08-11T01:17:08.502280+00:00"},{"alias_kind":"pith_short_12","alias_value":"DEFGPQK45KD4","created_at":"2026-08-11T01:17:08.502280+00:00"},{"alias_kind":"pith_short_16","alias_value":"DEFGPQK45KD4DLHQ","created_at":"2026-08-11T01:17:08.502280+00:00"},{"alias_kind":"pith_short_8","alias_value":"DEFGPQK4","created_at":"2026-08-11T01:17:08.502280+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ","json":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ.json","graph_json":"https://pith.science/api/pith-number/DEFGPQK45KD4DLHQOH5ZDMILGZ/graph.json","events_json":"https://pith.science/api/pith-number/DEFGPQK45KD4DLHQOH5ZDMILGZ/events.json","paper":"https://pith.science/paper/DEFGPQK4"},"agent_actions":{"view_html":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ","download_json":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ.json","view_paper":"https://pith.science/paper/DEFGPQK4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2604.02048&json=true","fetch_graph":"https://pith.science/api/pith-number/DEFGPQK45KD4DLHQOH5ZDMILGZ/graph.json","fetch_events":"https://pith.science/api/pith-number/DEFGPQK45KD4DLHQOH5ZDMILGZ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ/action/storage_attestation","attest_author":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ/action/author_attestation","sign_citation":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ/action/citation_signature","submit_replication":"https://pith.science/pith/DEFGPQK45KD4DLHQOH5ZDMILGZ/action/replication_record"}},"created_at":"2026-08-11T01:17:08.502280+00:00","updated_at":"2026-08-11T01:17:08.502280+00:00"}