{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2024:YTEP53SV2AFXOIW2MEICQFIF2U","short_pith_number":"pith:YTEP53SV","schema_version":"1.0","canonical_sha256":"c4c8feee55d00b7722da6110281505d52c9989c00514e8d78c0a1ed2f18913ad","source":{"kind":"arxiv","id":"2408.04594","version":3},"attestation_state":"computed","paper":{"title":"Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Bolin Ding, Daoyuan Chen, Qirui Jiao, Yaliang Li, Yilun Huang, Ying Shen","submitted_at":"2024-08-08T17:10:16Z","abstract_excerpt":"High-performance Multimodal Large Language Models (MLLMs) are heavily dependent on data quality. To advance fine-grained image recognition within MLLMs, we introduce a novel data synthesis method inspired by contrastive learning and image difference captioning. Our key idea involves challenging the model to discern both matching and distinct elements by scrutinizing object differences in detailed regions across similar images. We begin by generating pairs of similar images that emphasize object variations. Following this, we employ a Difference Area Generator to pinpoint object differences, an"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2408.04594","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2024-08-08T17:10:16Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"20e20b7c16a53812a969ec25f5b9c59fc2c1b819890a5331ec9721c80c3c9ed5","abstract_canon_sha256":"d6191b2cf019bcca2ad3f1d516fee92fe01edf47e8a158e23840a2821828559a"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T09:51:35.183588Z","signature_b64":"esdRcgcajr4/YmLzho7lirucNfaZ6ryCI2esC2eM3WuJM7WUCmIjz0OEz15F8M/2RCWQrvxAAMtdUfjpeQU2BQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c4c8feee55d00b7722da6110281505d52c9989c00514e8d78c0a1ed2f18913ad","last_reissued_at":"2026-07-05T09:51:35.183094Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T09:51:35.183094Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Img-Diff: Contrastive Data Synthesis for Multimodal Large Language Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CV","authors_text":"Bolin Ding, Daoyuan Chen, Qirui Jiao, Yaliang Li, Yilun Huang, Ying Shen","submitted_at":"2024-08-08T17:10:16Z","abstract_excerpt":"High-performance Multimodal Large Language Models (MLLMs) are heavily dependent on data quality. To advance fine-grained image recognition within MLLMs, we introduce a novel data synthesis method inspired by contrastive learning and image difference captioning. Our key idea involves challenging the model to discern both matching and distinct elements by scrutinizing object differences in detailed regions across similar images. We begin by generating pairs of similar images that emphasize object variations. Following this, we employ a Difference Area Generator to pinpoint object differences, an"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2408.04594","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2408.04594/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2408.04594","created_at":"2026-07-05T09:51:35.183151+00:00"},{"alias_kind":"arxiv_version","alias_value":"2408.04594v3","created_at":"2026-07-05T09:51:35.183151+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2408.04594","created_at":"2026-07-05T09:51:35.183151+00:00"},{"alias_kind":"pith_short_12","alias_value":"YTEP53SV2AFX","created_at":"2026-07-05T09:51:35.183151+00:00"},{"alias_kind":"pith_short_16","alias_value":"YTEP53SV2AFXOIW2","created_at":"2026-07-05T09:51:35.183151+00:00"},{"alias_kind":"pith_short_8","alias_value":"YTEP53SV","created_at":"2026-07-05T09:51:35.183151+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":2,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2603.13779","citing_title":"AD-Copilot: A Vision-Language Assistant for Industrial Anomaly Detection via Visual In-context Comparison","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2412.05271","citing_title":"Expanding Performance Boundaries of Open-Source Multimodal Models with Model, Data, and Test-Time Scaling","ref_index":101,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U","json":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U.json","graph_json":"https://pith.science/api/pith-number/YTEP53SV2AFXOIW2MEICQFIF2U/graph.json","events_json":"https://pith.science/api/pith-number/YTEP53SV2AFXOIW2MEICQFIF2U/events.json","paper":"https://pith.science/paper/YTEP53SV"},"agent_actions":{"view_html":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U","download_json":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U.json","view_paper":"https://pith.science/paper/YTEP53SV","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2408.04594&json=true","fetch_graph":"https://pith.science/api/pith-number/YTEP53SV2AFXOIW2MEICQFIF2U/graph.json","fetch_events":"https://pith.science/api/pith-number/YTEP53SV2AFXOIW2MEICQFIF2U/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U/action/storage_attestation","attest_author":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U/action/author_attestation","sign_citation":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U/action/citation_signature","submit_replication":"https://pith.science/pith/YTEP53SV2AFXOIW2MEICQFIF2U/action/replication_record"}},"created_at":"2026-07-05T09:51:35.183151+00:00","updated_at":"2026-07-05T09:51:35.183151+00:00"}