{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:KS2K77ZJCRA7BPNSD4VXEMKSKT","short_pith_number":"pith:KS2K77ZJ","schema_version":"1.0","canonical_sha256":"54b4afff291441f0bdb21f2b72315254caa23b789b0784b270e05cae6656fa64","source":{"kind":"arxiv","id":"2303.14301","version":4},"attestation_state":"computed","paper":{"title":"Natural Language-Based Synthetic Data Generation for Cluster Analysis","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["stat.CO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Michael J. Zellinger, Peter B\\\"uhlmann","submitted_at":"2023-03-24T23:45:27Z","abstract_excerpt":"Cluster analysis relies on effective benchmarks for evaluating and comparing different algorithms. Simulation studies on synthetic data are popular because important features of the data sets, such as the overlap between clusters, or the variation in cluster shapes, can be effectively varied. Unfortunately, creating evaluation scenarios is often laborious, as practitioners must translate higher-level scenario descriptions like \"clusters with very different shapes\" into lower-level geometric parameters such as cluster centers, covariance matrices, etc. To make benchmarks more convenient and inf"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2303.14301","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2023-03-24T23:45:27Z","cross_cats_sorted":["stat.CO","stat.ML"],"title_canon_sha256":"f50a562923fe041f31739b66e1f608859909e9fa77ef9b77a9bff6d70255ed76","abstract_canon_sha256":"50e99ed2d89b695c592c8e42bb38f7fdcb234621c7d4053785abdb72f036c442"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:15:41.248751Z","signature_b64":"5eGmq20YnLiKu4hygeyEN7SlxKoMOzxw5cGA59ecFCd0r3oS0MXK3XcoORJqQZCuluNCONu9AaADkqmfguxDCg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"54b4afff291441f0bdb21f2b72315254caa23b789b0784b270e05cae6656fa64","last_reissued_at":"2026-07-05T10:15:41.248212Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:15:41.248212Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Natural Language-Based Synthetic Data Generation for Cluster Analysis","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["stat.CO","stat.ML"],"primary_cat":"cs.LG","authors_text":"Michael J. Zellinger, Peter B\\\"uhlmann","submitted_at":"2023-03-24T23:45:27Z","abstract_excerpt":"Cluster analysis relies on effective benchmarks for evaluating and comparing different algorithms. Simulation studies on synthetic data are popular because important features of the data sets, such as the overlap between clusters, or the variation in cluster shapes, can be effectively varied. Unfortunately, creating evaluation scenarios is often laborious, as practitioners must translate higher-level scenario descriptions like \"clusters with very different shapes\" into lower-level geometric parameters such as cluster centers, covariance matrices, etc. To make benchmarks more convenient and inf"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2303.14301","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2303.14301/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2303.14301","created_at":"2026-07-05T10:15:41.248268+00:00"},{"alias_kind":"arxiv_version","alias_value":"2303.14301v4","created_at":"2026-07-05T10:15:41.248268+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2303.14301","created_at":"2026-07-05T10:15:41.248268+00:00"},{"alias_kind":"pith_short_12","alias_value":"KS2K77ZJCRA7","created_at":"2026-07-05T10:15:41.248268+00:00"},{"alias_kind":"pith_short_16","alias_value":"KS2K77ZJCRA7BPNS","created_at":"2026-07-05T10:15:41.248268+00:00"},{"alias_kind":"pith_short_8","alias_value":"KS2K77ZJ","created_at":"2026-07-05T10:15:41.248268+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT","json":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT.json","graph_json":"https://pith.science/api/pith-number/KS2K77ZJCRA7BPNSD4VXEMKSKT/graph.json","events_json":"https://pith.science/api/pith-number/KS2K77ZJCRA7BPNSD4VXEMKSKT/events.json","paper":"https://pith.science/paper/KS2K77ZJ"},"agent_actions":{"view_html":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT","download_json":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT.json","view_paper":"https://pith.science/paper/KS2K77ZJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2303.14301&json=true","fetch_graph":"https://pith.science/api/pith-number/KS2K77ZJCRA7BPNSD4VXEMKSKT/graph.json","fetch_events":"https://pith.science/api/pith-number/KS2K77ZJCRA7BPNSD4VXEMKSKT/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT/action/timestamp_anchor","attest_storage":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT/action/storage_attestation","attest_author":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT/action/author_attestation","sign_citation":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT/action/citation_signature","submit_replication":"https://pith.science/pith/KS2K77ZJCRA7BPNSD4VXEMKSKT/action/replication_record"}},"created_at":"2026-07-05T10:15:41.248268+00:00","updated_at":"2026-07-05T10:15:41.248268+00:00"}