{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:OEKNMEPMS55KJWQJK4WRI7SWPO","short_pith_number":"pith:OEKNMEPM","schema_version":"1.0","canonical_sha256":"7114d611ec977aa4da09572d147e567b9fc4592ddd877c6830a57ead0a56ee29","source":{"kind":"arxiv","id":"2601.22025","version":2},"attestation_state":"computed","paper":{"title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR","cs.SE"],"primary_cat":"cs.CL","authors_text":"Daniel Commey","submitted_at":"2026-01-29T17:32:34Z","abstract_excerpt":"Evaluating Large Language Model (LLM) applications differs from conventional software testing because outputs are probabilistic, semantically variable, and sensitive to prompt and model changes. This technical report proposes the Minimum Viable Evaluation Suite (MVES), an audit-oriented structure for application-level LLM evaluation. MVES links application categories to failure modes, metrics, required artifacts, and validation evidence across general LLM applications, retrieval-augmented systems, and agentic workflows. We pair the framework with a reproducible local evaluation harness coverin"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2601.22025","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2026-01-29T17:32:34Z","cross_cats_sorted":["cs.AI","cs.IR","cs.SE"],"title_canon_sha256":"6165e6e7f0192571d3d226663d9cd45d7d8364344e8ccc2724da570aed748c70","abstract_canon_sha256":"bf58489e53a2cb81f196da61dbc3e63d71786a0a1db90e1723fde69e412661c7"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-06-11T01:09:27.793066Z","signature_b64":"TGWhUQRPvzXru34DHp0qIacXv3fnIuYDxNwfMF7leQj1ZUC57sRMrw4CnWJihwDroVE+kKJFeF+TDPci7oVnDg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7114d611ec977aa4da09572d147e567b9fc4592ddd877c6830a57ead0a56ee29","last_reissued_at":"2026-06-11T01:09:27.792054Z","signature_status":"signed_v1","first_computed_at":"2026-06-11T01:09:27.792054Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR","cs.SE"],"primary_cat":"cs.CL","authors_text":"Daniel Commey","submitted_at":"2026-01-29T17:32:34Z","abstract_excerpt":"Evaluating Large Language Model (LLM) applications differs from conventional software testing because outputs are probabilistic, semantically variable, and sensitive to prompt and model changes. This technical report proposes the Minimum Viable Evaluation Suite (MVES), an audit-oriented structure for application-level LLM evaluation. MVES links application categories to failure modes, metrics, required artifacts, and validation evidence across general LLM applications, retrieval-augmented systems, and agentic workflows. We pair the framework with a reproducible local evaluation harness coverin"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2601.22025","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2601.22025/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2601.22025","created_at":"2026-06-11T01:09:27.792199+00:00"},{"alias_kind":"arxiv_version","alias_value":"2601.22025v2","created_at":"2026-06-11T01:09:27.792199+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2601.22025","created_at":"2026-06-11T01:09:27.792199+00:00"},{"alias_kind":"pith_short_12","alias_value":"OEKNMEPMS55K","created_at":"2026-06-11T01:09:27.792199+00:00"},{"alias_kind":"pith_short_16","alias_value":"OEKNMEPMS55KJWQJ","created_at":"2026-06-11T01:09:27.792199+00:00"},{"alias_kind":"pith_short_8","alias_value":"OEKNMEPM","created_at":"2026-06-11T01:09:27.792199+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO","json":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO.json","graph_json":"https://pith.science/api/pith-number/OEKNMEPMS55KJWQJK4WRI7SWPO/graph.json","events_json":"https://pith.science/api/pith-number/OEKNMEPMS55KJWQJK4WRI7SWPO/events.json","paper":"https://pith.science/paper/OEKNMEPM"},"agent_actions":{"view_html":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO","download_json":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO.json","view_paper":"https://pith.science/paper/OEKNMEPM","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2601.22025&json=true","fetch_graph":"https://pith.science/api/pith-number/OEKNMEPMS55KJWQJK4WRI7SWPO/graph.json","fetch_events":"https://pith.science/api/pith-number/OEKNMEPMS55KJWQJK4WRI7SWPO/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO/action/timestamp_anchor","attest_storage":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO/action/storage_attestation","attest_author":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO/action/author_attestation","sign_citation":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO/action/citation_signature","submit_replication":"https://pith.science/pith/OEKNMEPMS55KJWQJK4WRI7SWPO/action/replication_record"}},"created_at":"2026-06-11T01:09:27.792199+00:00","updated_at":"2026-06-11T01:09:27.792199+00:00"}