{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:G4TZV6KAHRNEV6JTVBKU6B4PVW","short_pith_number":"pith:G4TZV6KA","schema_version":"1.0","canonical_sha256":"37279af9403c5a4af933a8554f078fad8c77a15b4fe2c998a68265e6a2de8723","source":{"kind":"arxiv","id":"2504.13123","version":2},"attestation_state":"computed","paper":{"title":"Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Han Hu, Hu Hu, Runquan Xie, Xinsong Zhang, Xinting Huang, Yarong Zeng, Zhanhui Kang","submitted_at":"2025-04-17T17:40:06Z","abstract_excerpt":"In recent years, the field of vision-language model pre-training has experienced rapid advancements, driven primarily by the continuous enhancement of textual capabilities in large language models. However, existing training paradigms for multimodal large language models heavily rely on high-quality image-text pairs. As models and data scales grow exponentially, the availability of such meticulously curated data has become increasingly scarce and saturated, thereby severely limiting further advancements in this domain. This study investigates scalable caption generation techniques for vision-l"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.13123","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/publicdomain/zero/1.0/","primary_cat":"cs.CV","submitted_at":"2025-04-17T17:40:06Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"c813c302892ddffce511c8e14415ee222a25795d135cec0b964d3a416b001610","abstract_canon_sha256":"39735527ad076f9b0420151c9c3fe26b0f2648d0b416fd8cb72bdb87282ea957"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:04:49.163870Z","signature_b64":"qSjN6momHMO73kmBTMcdjJUsuZPxnKkPCdD9Ev9kwRvh7Xo0Ha19gLJ4cPphhi3UaaSBxBR2HqrynLE1cH4RDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"37279af9403c5a4af933a8554f078fad8c77a15b4fe2c998a68265e6a2de8723","last_reissued_at":"2026-07-05T11:04:49.163366Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:04:49.163366Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Low-hallucination Synthetic Captions for Large-Scale Vision-Language Model Pre-training","license":"http://creativecommons.org/publicdomain/zero/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Han Hu, Hu Hu, Runquan Xie, Xinsong Zhang, Xinting Huang, Yarong Zeng, Zhanhui Kang","submitted_at":"2025-04-17T17:40:06Z","abstract_excerpt":"In recent years, the field of vision-language model pre-training has experienced rapid advancements, driven primarily by the continuous enhancement of textual capabilities in large language models. However, existing training paradigms for multimodal large language models heavily rely on high-quality image-text pairs. As models and data scales grow exponentially, the availability of such meticulously curated data has become increasingly scarce and saturated, thereby severely limiting further advancements in this domain. This study investigates scalable caption generation techniques for vision-l"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.13123","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.13123/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.13123","created_at":"2026-07-05T11:04:49.163436+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.13123v2","created_at":"2026-07-05T11:04:49.163436+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.13123","created_at":"2026-07-05T11:04:49.163436+00:00"},{"alias_kind":"pith_short_12","alias_value":"G4TZV6KAHRNE","created_at":"2026-07-05T11:04:49.163436+00:00"},{"alias_kind":"pith_short_16","alias_value":"G4TZV6KAHRNEV6JT","created_at":"2026-07-05T11:04:49.163436+00:00"},{"alias_kind":"pith_short_8","alias_value":"G4TZV6KA","created_at":"2026-07-05T11:04:49.163436+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2505.14340","citing_title":"Plane Geometry Problem Solving with Multi-modal Reasoning: A Survey","ref_index":105,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW","json":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW.json","graph_json":"https://pith.science/api/pith-number/G4TZV6KAHRNEV6JTVBKU6B4PVW/graph.json","events_json":"https://pith.science/api/pith-number/G4TZV6KAHRNEV6JTVBKU6B4PVW/events.json","paper":"https://pith.science/paper/G4TZV6KA"},"agent_actions":{"view_html":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW","download_json":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW.json","view_paper":"https://pith.science/paper/G4TZV6KA","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.13123&json=true","fetch_graph":"https://pith.science/api/pith-number/G4TZV6KAHRNEV6JTVBKU6B4PVW/graph.json","fetch_events":"https://pith.science/api/pith-number/G4TZV6KAHRNEV6JTVBKU6B4PVW/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW/action/timestamp_anchor","attest_storage":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW/action/storage_attestation","attest_author":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW/action/author_attestation","sign_citation":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW/action/citation_signature","submit_replication":"https://pith.science/pith/G4TZV6KAHRNEV6JTVBKU6B4PVW/action/replication_record"}},"created_at":"2026-07-05T11:04:49.163436+00:00","updated_at":"2026-07-05T11:04:49.163436+00:00"}