{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:L3JV57CO6MSDE6WLS44VA4RYKI","short_pith_number":"pith:L3JV57CO","schema_version":"1.0","canonical_sha256":"5ed35efc4ef324327acb97395072385221f6fb2fa535d10921e75cb885f38186","source":{"kind":"arxiv","id":"2312.03025","version":1},"attestation_state":"computed","paper":{"title":"Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.CV","cs.LG"],"primary_cat":"cs.AI","authors_text":"Boyang Li, Haoxin Li, Xu Guo, Zilin Du","submitted_at":"2023-12-05T08:11:34Z","abstract_excerpt":"The task of multimodal relation extraction has attracted significant research attention, but progress is constrained by the scarcity of available training data. One natural thought is to extend existing datasets with cross-modal generative models. In this paper, we consider a novel problem setting, where only unimodal data, either text or image, are available during training. We aim to train a multimodal classifier from synthetic data that perform well on real multimodal test data. However, training with synthetic data suffers from two obstacles: lack of data diversity and label information lo"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2312.03025","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2023-12-05T08:11:34Z","cross_cats_sorted":["cs.CL","cs.CV","cs.LG"],"title_canon_sha256":"739875b1416b27ba5dac28529468cb8b864264dfeec62bd029521149469cbc4b","abstract_canon_sha256":"46c9e220c1f30b2da1f8199d8a88c611abfb48745a5d8815c21801b66d4e3feb"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:20:57.137884Z","signature_b64":"kD+j7JgVBL2CAy4R/GXmIGtECUZWORq8lYMt3psOM2q6lQAIwSPXCOxUtqlbkkWmr6co/PTA7kmXfkEP0eVNBQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"5ed35efc4ef324327acb97395072385221f6fb2fa535d10921e75cb885f38186","last_reissued_at":"2026-07-05T07:20:57.137419Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:20:57.137419Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Training on Synthetic Data Beats Real Data in Multimodal Relation Extraction","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.CL","cs.CV","cs.LG"],"primary_cat":"cs.AI","authors_text":"Boyang Li, Haoxin Li, Xu Guo, Zilin Du","submitted_at":"2023-12-05T08:11:34Z","abstract_excerpt":"The task of multimodal relation extraction has attracted significant research attention, but progress is constrained by the scarcity of available training data. One natural thought is to extend existing datasets with cross-modal generative models. In this paper, we consider a novel problem setting, where only unimodal data, either text or image, are available during training. We aim to train a multimodal classifier from synthetic data that perform well on real multimodal test data. However, training with synthetic data suffers from two obstacles: lack of data diversity and label information lo"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2312.03025","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2312.03025/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2312.03025","created_at":"2026-07-05T07:20:57.137477+00:00"},{"alias_kind":"arxiv_version","alias_value":"2312.03025v1","created_at":"2026-07-05T07:20:57.137477+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2312.03025","created_at":"2026-07-05T07:20:57.137477+00:00"},{"alias_kind":"pith_short_12","alias_value":"L3JV57CO6MSD","created_at":"2026-07-05T07:20:57.137477+00:00"},{"alias_kind":"pith_short_16","alias_value":"L3JV57CO6MSDE6WL","created_at":"2026-07-05T07:20:57.137477+00:00"},{"alias_kind":"pith_short_8","alias_value":"L3JV57CO","created_at":"2026-07-05T07:20:57.137477+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":1,"sample":[{"citing_arxiv_id":"2507.08513","citing_title":"Advancing Multimodal LLMs by Large-Scale 3D Visual Instruction Dataset Generation","ref_index":13,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI","json":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI.json","graph_json":"https://pith.science/api/pith-number/L3JV57CO6MSDE6WLS44VA4RYKI/graph.json","events_json":"https://pith.science/api/pith-number/L3JV57CO6MSDE6WLS44VA4RYKI/events.json","paper":"https://pith.science/paper/L3JV57CO"},"agent_actions":{"view_html":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI","download_json":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI.json","view_paper":"https://pith.science/paper/L3JV57CO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2312.03025&json=true","fetch_graph":"https://pith.science/api/pith-number/L3JV57CO6MSDE6WLS44VA4RYKI/graph.json","fetch_events":"https://pith.science/api/pith-number/L3JV57CO6MSDE6WLS44VA4RYKI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI/action/storage_attestation","attest_author":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI/action/author_attestation","sign_citation":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI/action/citation_signature","submit_replication":"https://pith.science/pith/L3JV57CO6MSDE6WLS44VA4RYKI/action/replication_record"}},"created_at":"2026-07-05T07:20:57.137477+00:00","updated_at":"2026-07-05T07:20:57.137477+00:00"}