{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:ENXRTYYS47D5A4WY7DDWKWXNQI","short_pith_number":"pith:ENXRTYYS","schema_version":"1.0","canonical_sha256":"236f19e312e7c7d072d8f8c7655aed823b10f0fdc20df51c6de2e099dc152426","source":{"kind":"arxiv","id":"2510.22510","version":3},"attestation_state":"computed","paper":{"title":"CANDI: Hybrid Discrete-Continuous Diffusion Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["stat.ML"],"primary_cat":"cs.LG","authors_text":"Jiaxin Shi, Patrick Pynadath, Ruqi Zhang","submitted_at":"2025-10-26T03:24:31Z","abstract_excerpt":"While continuous diffusion has shown remarkable success in continuous domains such as image generation, its direct application to discrete data has underperformed pure discrete formulations. To understand this gap, we introduce token identifiability, an analytical framework characterizing how Gaussian noise corrupts discrete data through two mechanisms: discrete identity corruption and continuous rank degradation. We reveal that these mechanisms scale differently with vocabulary size, creating a temporal dissonance that forces a tradeoff between learning continuous geometry and discrete struct"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2510.22510","kind":"arxiv","version":3},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2025-10-26T03:24:31Z","cross_cats_sorted":["stat.ML"],"title_canon_sha256":"26ab7eb3367bb49f0aa6ced207cb5907e6cacd3a62172e395ecc7e2287abc5ff","abstract_canon_sha256":"2d41956d1f7345ed1b12ea57dc1299baaa5580347a2b5e11feca9afe3d136b37"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-14T01:20:47.641281Z","signature_b64":"gOm2QpTwPaV9kgMQ1l+BxBPzBqNDGfViCYe76RB9V7mZ4tsxZP8aTG2jJJHU8RO9y6PTk5G0PYKISVaKJKNHDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"236f19e312e7c7d072d8f8c7655aed823b10f0fdc20df51c6de2e099dc152426","last_reissued_at":"2026-07-14T01:20:47.638568Z","signature_status":"signed_v1","first_computed_at":"2026-07-14T01:20:47.638568Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CANDI: Hybrid Discrete-Continuous Diffusion Models","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["stat.ML"],"primary_cat":"cs.LG","authors_text":"Jiaxin Shi, Patrick Pynadath, Ruqi Zhang","submitted_at":"2025-10-26T03:24:31Z","abstract_excerpt":"While continuous diffusion has shown remarkable success in continuous domains such as image generation, its direct application to discrete data has underperformed pure discrete formulations. To understand this gap, we introduce token identifiability, an analytical framework characterizing how Gaussian noise corrupts discrete data through two mechanisms: discrete identity corruption and continuous rank degradation. We reveal that these mechanisms scale differently with vocabulary size, creating a temporal dissonance that forces a tradeoff between learning continuous geometry and discrete struct"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2510.22510","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2510.22510/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2510.22510","created_at":"2026-07-14T01:20:47.640774+00:00"},{"alias_kind":"arxiv_version","alias_value":"2510.22510v3","created_at":"2026-07-14T01:20:47.640774+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2510.22510","created_at":"2026-07-14T01:20:47.640774+00:00"},{"alias_kind":"pith_short_12","alias_value":"ENXRTYYS47D5","created_at":"2026-07-14T01:20:47.640774+00:00"},{"alias_kind":"pith_short_16","alias_value":"ENXRTYYS47D5A4WY","created_at":"2026-07-14T01:20:47.640774+00:00"},{"alias_kind":"pith_short_8","alias_value":"ENXRTYYS","created_at":"2026-07-14T01:20:47.640774+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":12,"sample":[{"citing_arxiv_id":"2606.08417","citing_title":"Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics","ref_index":24,"is_internal_anchor":true},{"citing_arxiv_id":"2607.00714","citing_title":"Self-conditioned Flow Map Language Models via Fixed-point Flows","ref_index":18,"is_internal_anchor":true},{"citing_arxiv_id":"2606.27617","citing_title":"Masked Language Flow Models","ref_index":36,"is_internal_anchor":true},{"citing_arxiv_id":"2606.27627","citing_title":"HybridCodec: Modeling Discrete and Continuous Representations for Efficient Speech Language Models","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"2605.23605","citing_title":"DiLaDiff: Distilled Latent-Augmented Diffusion for Language Modeling","ref_index":5,"is_internal_anchor":true},{"citing_arxiv_id":"2602.16813","citing_title":"Flow Map Language Models: One-step Language Modeling via Continuous Denoising","ref_index":21,"is_internal_anchor":true},{"citing_arxiv_id":"2605.18530","citing_title":"Continuous Diffusion Scales Competitively with Discrete Diffusion for Language","ref_index":50,"is_internal_anchor":true},{"citing_arxiv_id":"2602.16813","citing_title":"Flow Map Language Models: One-step Language Modeling via Continuous Denoising","ref_index":21,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12836","citing_title":"Discrete Stochastic Localization for Non-autoregressive Generation","ref_index":19,"is_internal_anchor":true},{"citing_arxiv_id":"2605.13026","citing_title":"Understanding and Accelerating the Training of Masked Diffusion Language Models","ref_index":54,"is_internal_anchor":true},{"citing_arxiv_id":"2604.02718","citing_title":"Generative Frontiers: Why Evaluation Matters for Diffusion Language Models","ref_index":7,"is_internal_anchor":true},{"citing_arxiv_id":"2605.07193","citing_title":"Coupling Models for One-Step Discrete Generation","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI","json":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI.json","graph_json":"https://pith.science/api/pith-number/ENXRTYYS47D5A4WY7DDWKWXNQI/graph.json","events_json":"https://pith.science/api/pith-number/ENXRTYYS47D5A4WY7DDWKWXNQI/events.json","paper":"https://pith.science/paper/ENXRTYYS"},"agent_actions":{"view_html":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI","download_json":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI.json","view_paper":"https://pith.science/paper/ENXRTYYS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2510.22510&json=true","fetch_graph":"https://pith.science/api/pith-number/ENXRTYYS47D5A4WY7DDWKWXNQI/graph.json","fetch_events":"https://pith.science/api/pith-number/ENXRTYYS47D5A4WY7DDWKWXNQI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI/action/storage_attestation","attest_author":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI/action/author_attestation","sign_citation":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI/action/citation_signature","submit_replication":"https://pith.science/pith/ENXRTYYS47D5A4WY7DDWKWXNQI/action/replication_record"}},"created_at":"2026-07-14T01:20:47.640774+00:00","updated_at":"2026-07-14T01:20:47.640774+00:00"}