{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:2WD7GD4WWIZBKGCI3RU6GMBSL7","short_pith_number":"pith:2WD7GD4W","schema_version":"1.0","canonical_sha256":"d587f30f96b232151848dc69e330325fcc93b7783d570cd5d498e25f374c7fa4","source":{"kind":"arxiv","id":"2501.01423","version":3},"attestation_state":"computed","paper":{"title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bin Yang, Jingfeng Yao, Xinggang Wang","submitted_at":"2025-01-02T18:59:40Z","abstract_excerpt":"Latent diffusion models with Transformer architectures excel at generating high-fidelity images. However, recent studies reveal an optimization dilemma in this two-stage design: while increasing the per-token feature dimension in visual tokenizers improves reconstruction quality, it requires substantially larger diffusion models and more training iterations to achieve comparable generation performance. Consequently, existing systems often settle for sub-optimal solutions, either producing visual artifacts due to information loss within tokenizers or failing to converge fully due to expensive c"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2501.01423","kind":"arxiv","version":3},"metadata":{"license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-01-02T18:59:40Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"66aded50412b2010f35641acf164f4036356602167da3d7c146e8cfac1c26285","abstract_canon_sha256":"8e44a7ad9c875d9cba554002144672e31c15cd31c72711ce81cd3c4247d283ff"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:27:22.741030Z","signature_b64":"Xin3WjEhtexceUOD/m1n9rJYQ2bsaYrfIirL0YhWwLSmZumEjmpzSMTIlK88oc0Gzosh35PLO4wiub2MB8MqAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"d587f30f96b232151848dc69e330325fcc93b7783d570cd5d498e25f374c7fa4","last_reissued_at":"2026-07-05T10:27:22.740328Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:27:22.740328Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Reconstruction vs. Generation: Taming Optimization Dilemma in Latent Diffusion Models","license":"http://creativecommons.org/licenses/by-nc-sa/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.CV","authors_text":"Bin Yang, Jingfeng Yao, Xinggang Wang","submitted_at":"2025-01-02T18:59:40Z","abstract_excerpt":"Latent diffusion models with Transformer architectures excel at generating high-fidelity images. However, recent studies reveal an optimization dilemma in this two-stage design: while increasing the per-token feature dimension in visual tokenizers improves reconstruction quality, it requires substantially larger diffusion models and more training iterations to achieve comparable generation performance. Consequently, existing systems often settle for sub-optimal solutions, either producing visual artifacts due to information loss within tokenizers or failing to converge fully due to expensive c"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.01423","kind":"arxiv","version":3},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.01423/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2501.01423","created_at":"2026-07-05T10:27:22.740410+00:00"},{"alias_kind":"arxiv_version","alias_value":"2501.01423v3","created_at":"2026-07-05T10:27:22.740410+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.01423","created_at":"2026-07-05T10:27:22.740410+00:00"},{"alias_kind":"pith_short_12","alias_value":"2WD7GD4WWIZB","created_at":"2026-07-05T10:27:22.740410+00:00"},{"alias_kind":"pith_short_16","alias_value":"2WD7GD4WWIZBKGCI","created_at":"2026-07-05T10:27:22.740410+00:00"},{"alias_kind":"pith_short_8","alias_value":"2WD7GD4W","created_at":"2026-07-05T10:27:22.740410+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":10,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26016","citing_title":"MIMFlow: Integrating Masked Image Modeling with Normalizing Flows for End-to-End Image Generation","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2606.24888","citing_title":"DiffusionBench: On Holistic Evaluation of Diffusion Transformers","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29059","citing_title":"Flow Matching in Feature Space for Stochastic World Modeling","ref_index":12,"is_internal_anchor":false},{"citing_arxiv_id":"2605.30341","citing_title":"GPIC: A Giant Permissive Image Corpus for Visual Generation","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2605.18324","citing_title":"Improved Baselines with Representation Autoencoders","ref_index":62,"is_internal_anchor":false},{"citing_arxiv_id":"2511.19365","citing_title":"DeCo: Frequency-Decoupled Pixel Diffusion for End-to-End Image Generation","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2602.02493","citing_title":"PixelGen: Improving Pixel Diffusion with Perceptual Supervision","ref_index":23,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12011","citing_title":"CaloArt: Large-Patch x-Prediction Diffusion Transformers for High-Granularity Calorimeter Shower Generation","ref_index":44,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05331","citing_title":"ViTok-v2: Scaling Native Resolution Auto-Encoders to 5 Billion Parameters","ref_index":16,"is_internal_anchor":false},{"citing_arxiv_id":"2605.00503","citing_title":"End-to-End Autoregressive Image Generation with 1D Semantic Tokenizer","ref_index":44,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7","json":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7.json","graph_json":"https://pith.science/api/pith-number/2WD7GD4WWIZBKGCI3RU6GMBSL7/graph.json","events_json":"https://pith.science/api/pith-number/2WD7GD4WWIZBKGCI3RU6GMBSL7/events.json","paper":"https://pith.science/paper/2WD7GD4W"},"agent_actions":{"view_html":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7","download_json":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7.json","view_paper":"https://pith.science/paper/2WD7GD4W","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2501.01423&json=true","fetch_graph":"https://pith.science/api/pith-number/2WD7GD4WWIZBKGCI3RU6GMBSL7/graph.json","fetch_events":"https://pith.science/api/pith-number/2WD7GD4WWIZBKGCI3RU6GMBSL7/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7/action/timestamp_anchor","attest_storage":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7/action/storage_attestation","attest_author":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7/action/author_attestation","sign_citation":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7/action/citation_signature","submit_replication":"https://pith.science/pith/2WD7GD4WWIZBKGCI3RU6GMBSL7/action/replication_record"}},"created_at":"2026-07-05T10:27:22.740410+00:00","updated_at":"2026-07-05T10:27:22.740410+00:00"}