{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:P4YHE2OVIXSCCXANNV3KUCD3YQ","short_pith_number":"pith:P4YHE2OV","canonical_record":{"source":{"id":"2510.17868","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SE","submitted_at":"2025-10-16T05:07:12Z","cross_cats_sorted":[],"title_canon_sha256":"9530e84cfcfed81e5315b9c99983bb58a977a19eb13b1f1ffc2c2028612b9baf","abstract_canon_sha256":"9b911e3aa700c6dfdad3bb3ea7be6dd6998ee0b5e6797689305a18fb85c4fe35"},"schema_version":"1.0"},"canonical_sha256":"7f307269d545e4215c0d6d76aa087bc41b43bd0d30131d679a5c010e76e625d6","source":{"kind":"arxiv","id":"2510.17868","version":3},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2510.17868","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"arxiv_version","alias_value":"2510.17868v3","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2510.17868","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"pith_short_12","alias_value":"P4YHE2OVIXSC","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"pith_short_16","alias_value":"P4YHE2OVIXSCCXAN","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"pith_short_8","alias_value":"P4YHE2OV","created_at":"2026-07-16T01:22:28Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:P4YHE2OVIXSCCXANNV3KUCD3YQ","target":"record","payload":{"canonical_record":{"source":{"id":"2510.17868","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SE","submitted_at":"2025-10-16T05:07:12Z","cross_cats_sorted":[],"title_canon_sha256":"9530e84cfcfed81e5315b9c99983bb58a977a19eb13b1f1ffc2c2028612b9baf","abstract_canon_sha256":"9b911e3aa700c6dfdad3bb3ea7be6dd6998ee0b5e6797689305a18fb85c4fe35"},"schema_version":"1.0"},"canonical_sha256":"7f307269d545e4215c0d6d76aa087bc41b43bd0d30131d679a5c010e76e625d6","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-16T01:22:28.942060Z","signature_b64":"izVVk4h1VGk1irN/TUG1J2JZqyBUwul8XsV3h97pDXl8FsvCF9JLt3f4JXJa9Qs2V3dJbNYRiAe/oJTD98JvAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7f307269d545e4215c0d6d76aa087bc41b43bd0d30131d679a5c010e76e625d6","last_reissued_at":"2026-07-16T01:22:28.941064Z","signature_status":"signed_v1","first_computed_at":"2026-07-16T01:22:28.941064Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2510.17868","source_version":3,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-16T01:22:28Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"LT4qC8p4h789PfA57vMjHpa+V58pfyBEx57VBH86EpWG6oqudwl/e6dMG2/XkAnrVheAiCkbVQafRD6rtVExAg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-06T02:29:53.707839Z"},"content_sha256":"9eeba01c61b7e59511afc4510749f7463ff5e440b467ad8df17eda93286ccac2","schema_version":"1.0","event_id":"sha256:9eeba01c61b7e59511afc4510749f7463ff5e440b467ad8df17eda93286ccac2"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:P4YHE2OVIXSCCXANNV3KUCD3YQ","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"UniCode: Augmenting Evaluation for Code Reasoning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.SE","authors_text":"Haowei Lin, Shaofei Cai, Xinyue Zheng, Yaodong Yang, Yitao Liang, Zilong Zheng","submitted_at":"2025-10-16T05:07:12Z","abstract_excerpt":"Current coding benchmarks often inflate Large Language Model (LLM) capabilities due to static paradigms and data contamination, enabling models to exploit statistical shortcuts rather than genuine reasoning. To address this, we introduce UniCode, a generative evaluation framework that systematically probes LLM limits via: (1) multi-dimensional augmentation transforming seed problems into complex variations to disrupt fixed algorithmic patterns; (2) a highly reliable, automated test generation pipeline for scalable evaluation; and (3) fine-grained metrics for rich error signals. Experiments rev"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2510.17868","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2510.17868/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-16T01:22:28Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"8tR2tzKd4nVAGqO5jn14gl6u6BcHSYYsT0FAxTIXqdGgpurdGGfoDRpyuIWXdmr5cqEe80uXuqpJ82MQcFukBA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-06T02:29:53.708346Z"},"content_sha256":"11a322e4fbefe8dee0dd5a615a7a038ee9797803e4ea9b280f9f8a5e608a6697","schema_version":"1.0","event_id":"sha256:11a322e4fbefe8dee0dd5a615a7a038ee9797803e4ea9b280f9f8a5e608a6697"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ/bundle.json","state_url":"https://pith.science/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-06T02:29:53Z","links":{"resolver":"https://pith.science/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ","bundle":"https://pith.science/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ/bundle.json","state":"https://pith.science/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ/state.json","well_known_bundle":"https://pith.science/.well-known/pith/P4YHE2OVIXSCCXANNV3KUCD3YQ/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:P4YHE2OVIXSCCXANNV3KUCD3YQ","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"9b911e3aa700c6dfdad3bb3ea7be6dd6998ee0b5e6797689305a18fb85c4fe35","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SE","submitted_at":"2025-10-16T05:07:12Z","title_canon_sha256":"9530e84cfcfed81e5315b9c99983bb58a977a19eb13b1f1ffc2c2028612b9baf"},"schema_version":"1.0","source":{"id":"2510.17868","kind":"arxiv","version":3}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2510.17868","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"arxiv_version","alias_value":"2510.17868v3","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2510.17868","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"pith_short_12","alias_value":"P4YHE2OVIXSC","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"pith_short_16","alias_value":"P4YHE2OVIXSCCXAN","created_at":"2026-07-16T01:22:28Z"},{"alias_kind":"pith_short_8","alias_value":"P4YHE2OV","created_at":"2026-07-16T01:22:28Z"}],"graph_snapshots":[{"event_id":"sha256:11a322e4fbefe8dee0dd5a615a7a038ee9797803e4ea9b280f9f8a5e608a6697","target":"graph","created_at":"2026-07-16T01:22:28Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2510.17868/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Current coding benchmarks often inflate Large Language Model (LLM) capabilities due to static paradigms and data contamination, enabling models to exploit statistical shortcuts rather than genuine reasoning. To address this, we introduce UniCode, a generative evaluation framework that systematically probes LLM limits via: (1) multi-dimensional augmentation transforming seed problems into complex variations to disrupt fixed algorithmic patterns; (2) a highly reliable, automated test generation pipeline for scalable evaluation; and (3) fine-grained metrics for rich error signals. Experiments rev","authors_text":"Haowei Lin, Shaofei Cai, Xinyue Zheng, Yaodong Yang, Yitao Liang, Zilong Zheng","cross_cats":[],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SE","submitted_at":"2025-10-16T05:07:12Z","title":"UniCode: Augmenting Evaluation for Code Reasoning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2510.17868","kind":"arxiv","version":3},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:9eeba01c61b7e59511afc4510749f7463ff5e440b467ad8df17eda93286ccac2","target":"record","created_at":"2026-07-16T01:22:28Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"9b911e3aa700c6dfdad3bb3ea7be6dd6998ee0b5e6797689305a18fb85c4fe35","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.SE","submitted_at":"2025-10-16T05:07:12Z","title_canon_sha256":"9530e84cfcfed81e5315b9c99983bb58a977a19eb13b1f1ffc2c2028612b9baf"},"schema_version":"1.0","source":{"id":"2510.17868","kind":"arxiv","version":3}},"canonical_sha256":"7f307269d545e4215c0d6d76aa087bc41b43bd0d30131d679a5c010e76e625d6","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"7f307269d545e4215c0d6d76aa087bc41b43bd0d30131d679a5c010e76e625d6","first_computed_at":"2026-07-16T01:22:28.941064Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-16T01:22:28.941064Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"izVVk4h1VGk1irN/TUG1J2JZqyBUwul8XsV3h97pDXl8FsvCF9JLt3f4JXJa9Qs2V3dJbNYRiAe/oJTD98JvAg==","signature_status":"signed_v1","signed_at":"2026-07-16T01:22:28.942060Z","signed_message":"canonical_sha256_bytes"},"source_id":"2510.17868","source_kind":"arxiv","source_version":3}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:9eeba01c61b7e59511afc4510749f7463ff5e440b467ad8df17eda93286ccac2","sha256:11a322e4fbefe8dee0dd5a615a7a038ee9797803e4ea9b280f9f8a5e608a6697"],"state_sha256":"4da59bd1b1180b2924fe1041d6de3a841196e5dcb68baa3a28d907d6d26ad0fc"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"OzYZ3TKX5XoCMtyAsWCJbQjD9WQTYc2TDYCC5w4nQbjvr03RdIS/rPbg54Prv93AAVAtHysucWww+JKdmzFrCQ==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-06T02:29:53.711825Z","bundle_sha256":"8bab811247cde9ecbf5755a0b1a89c102af930bf53c3e120541709b7fc4a6312"}}