{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:D24G6AOJP5QZTNHUEP6FLK7EP3","short_pith_number":"pith:D24G6AOJ","schema_version":"1.0","canonical_sha256":"1eb86f01c97f6199b4f423fc55abe47eef62dba4af59ac14c3ccf636fe65bbef","source":{"kind":"arxiv","id":"2504.15784","version":1},"attestation_state":"computed","paper":{"title":"Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Benfeng Xu, Chiwei Zhu, Ruizhe Li, Xiaorui Wang, Zhendong Mao","submitted_at":"2025-04-22T10:52:23Z","abstract_excerpt":"Creative writing is a key capability of Large Language Models (LLMs), with potential applications in literature, storytelling, and various creative domains. However, evaluating the creativity of machine-generated texts remains a significant challenge, as existing methods either rely on costly manual annotations or fail to align closely with human assessments. In this paper, we propose an effective automated evaluation method based on the Torrance Test of Creative Writing (TTCW), which evaluates creativity as product. Our method employs a reference-based Likert-style approach, scoring generated"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.15784","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CL","submitted_at":"2025-04-22T10:52:23Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"4954686f9266639d24c7a01aaebf3e964e0b786fc7e5af9503f0ce183a4ceff3","abstract_canon_sha256":"4079082da979f56d371ee622d5ad626fe7c35e91647f3316b6759c12d72a79c2"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:52:29.903070Z","signature_b64":"OdDA5MQPNgOv8PDR6Nf7Uj7U0pJ1Wgsvkuisjm+pMV7z9R0JHlgoUcfaInUn1Pf10QAanxT2Oos8PwcK1wmrAQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"1eb86f01c97f6199b4f423fc55abe47eef62dba4af59ac14c3ccf636fe65bbef","last_reissued_at":"2026-07-05T10:52:29.902564Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:52:29.902564Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Automated Creativity Evaluation for Large Language Models: A Reference-Based Approach","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.CL","authors_text":"Benfeng Xu, Chiwei Zhu, Ruizhe Li, Xiaorui Wang, Zhendong Mao","submitted_at":"2025-04-22T10:52:23Z","abstract_excerpt":"Creative writing is a key capability of Large Language Models (LLMs), with potential applications in literature, storytelling, and various creative domains. However, evaluating the creativity of machine-generated texts remains a significant challenge, as existing methods either rely on costly manual annotations or fail to align closely with human assessments. In this paper, we propose an effective automated evaluation method based on the Torrance Test of Creative Writing (TTCW), which evaluates creativity as product. Our method employs a reference-based Likert-style approach, scoring generated"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.15784","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.15784/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.15784","created_at":"2026-07-05T10:52:29.902622+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.15784v1","created_at":"2026-07-05T10:52:29.902622+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.15784","created_at":"2026-07-05T10:52:29.902622+00:00"},{"alias_kind":"pith_short_12","alias_value":"D24G6AOJP5QZ","created_at":"2026-07-05T10:52:29.902622+00:00"},{"alias_kind":"pith_short_16","alias_value":"D24G6AOJP5QZTNHU","created_at":"2026-07-05T10:52:29.902622+00:00"},{"alias_kind":"pith_short_8","alias_value":"D24G6AOJ","created_at":"2026-07-05T10:52:29.902622+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":4,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.07226","citing_title":"DEFINED: A Data-Efficient Computational Framework for Fine-Grained Creativity Assessment in Debate Scenarios","ref_index":21,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00875","citing_title":"IDEAFix: Evaluation Framework for Creative Defixation Prompting in LLMs","ref_index":33,"is_internal_anchor":false},{"citing_arxiv_id":"2606.10113","citing_title":"Emotion Profiling in LLM-Based Literary Translation: Systematic Shifts Across MT and Post-Editing","ref_index":217,"is_internal_anchor":false},{"citing_arxiv_id":"2604.05517","citing_title":"UniCreative: Unifying Long-form Logic and Short-form Sparkle via Reference-Free Reinforcement Learning","ref_index":1,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3","json":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3.json","graph_json":"https://pith.science/api/pith-number/D24G6AOJP5QZTNHUEP6FLK7EP3/graph.json","events_json":"https://pith.science/api/pith-number/D24G6AOJP5QZTNHUEP6FLK7EP3/events.json","paper":"https://pith.science/paper/D24G6AOJ"},"agent_actions":{"view_html":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3","download_json":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3.json","view_paper":"https://pith.science/paper/D24G6AOJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.15784&json=true","fetch_graph":"https://pith.science/api/pith-number/D24G6AOJP5QZTNHUEP6FLK7EP3/graph.json","fetch_events":"https://pith.science/api/pith-number/D24G6AOJP5QZTNHUEP6FLK7EP3/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3/action/timestamp_anchor","attest_storage":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3/action/storage_attestation","attest_author":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3/action/author_attestation","sign_citation":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3/action/citation_signature","submit_replication":"https://pith.science/pith/D24G6AOJP5QZTNHUEP6FLK7EP3/action/replication_record"}},"created_at":"2026-07-05T10:52:29.902622+00:00","updated_at":"2026-07-05T10:52:29.902622+00:00"}