{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:X3RWQ5HSPOYXCL45JNUZCOIKEH","short_pith_number":"pith:X3RWQ5HS","schema_version":"1.0","canonical_sha256":"bee36874f27bb1712f9d4b6991390a21d8826d8a116ceeaa5d9caa5992e7b1e1","source":{"kind":"arxiv","id":"2506.19798","version":1},"attestation_state":"computed","paper":{"title":"CoCo4D: Comprehensive and Complex 4D Scene Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Junwei Zhou, Lu Qi, Ming-Hsuan Yang, Xueting Li","submitted_at":"2025-06-24T17:05:44Z","abstract_excerpt":"Existing 4D synthesis methods primarily focus on object-level generation or dynamic scene synthesis with limited novel views, restricting their ability to generate multi-view consistent and immersive dynamic 4D scenes. To address these constraints, we propose a framework (dubbed as CoCo4D) for generating detailed dynamic 4D scenes from text prompts, with the option to include images. Our method leverages the crucial observation that articulated motion typically characterizes foreground objects, whereas background alterations are less pronounced. Consequently, CoCo4D divides 4D scene synthesis "},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.19798","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CV","submitted_at":"2025-06-24T17:05:44Z","cross_cats_sorted":[],"title_canon_sha256":"f1996fe30bb9cea3522f980a97cd318defe5629ea4bd0d7afb6be8d2cf298e59","abstract_canon_sha256":"a42816c49a5259a50ff585d3bb273ae8393b774226cbf6ac78796a998d68a1d3"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:26:38.861410Z","signature_b64":"l4ZjAhACWtT+ssx+ghXnLlUorUPVP48KQJ+cG2EgaiKlTqYFetpMIMcx2pp8w2rz/BplG9An8KV9Gxy7urAzBg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"bee36874f27bb1712f9d4b6991390a21d8826d8a116ceeaa5d9caa5992e7b1e1","last_reissued_at":"2026-07-05T11:26:38.860927Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:26:38.860927Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"CoCo4D: Comprehensive and Complex 4D Scene Generation","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.CV","authors_text":"Junwei Zhou, Lu Qi, Ming-Hsuan Yang, Xueting Li","submitted_at":"2025-06-24T17:05:44Z","abstract_excerpt":"Existing 4D synthesis methods primarily focus on object-level generation or dynamic scene synthesis with limited novel views, restricting their ability to generate multi-view consistent and immersive dynamic 4D scenes. To address these constraints, we propose a framework (dubbed as CoCo4D) for generating detailed dynamic 4D scenes from text prompts, with the option to include images. Our method leverages the crucial observation that articulated motion typically characterizes foreground objects, whereas background alterations are less pronounced. Consequently, CoCo4D divides 4D scene synthesis "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.19798","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.19798/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.19798","created_at":"2026-07-05T11:26:38.860979+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.19798v1","created_at":"2026-07-05T11:26:38.860979+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.19798","created_at":"2026-07-05T11:26:38.860979+00:00"},{"alias_kind":"pith_short_12","alias_value":"X3RWQ5HSPOYX","created_at":"2026-07-05T11:26:38.860979+00:00"},{"alias_kind":"pith_short_16","alias_value":"X3RWQ5HSPOYXCL45","created_at":"2026-07-05T11:26:38.860979+00:00"},{"alias_kind":"pith_short_8","alias_value":"X3RWQ5HS","created_at":"2026-07-05T11:26:38.860979+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.25326","citing_title":"Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation","ref_index":63,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH","json":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH.json","graph_json":"https://pith.science/api/pith-number/X3RWQ5HSPOYXCL45JNUZCOIKEH/graph.json","events_json":"https://pith.science/api/pith-number/X3RWQ5HSPOYXCL45JNUZCOIKEH/events.json","paper":"https://pith.science/paper/X3RWQ5HS"},"agent_actions":{"view_html":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH","download_json":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH.json","view_paper":"https://pith.science/paper/X3RWQ5HS","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.19798&json=true","fetch_graph":"https://pith.science/api/pith-number/X3RWQ5HSPOYXCL45JNUZCOIKEH/graph.json","fetch_events":"https://pith.science/api/pith-number/X3RWQ5HSPOYXCL45JNUZCOIKEH/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH/action/timestamp_anchor","attest_storage":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH/action/storage_attestation","attest_author":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH/action/author_attestation","sign_citation":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH/action/citation_signature","submit_replication":"https://pith.science/pith/X3RWQ5HSPOYXCL45JNUZCOIKEH/action/replication_record"}},"created_at":"2026-07-05T11:26:38.860979+00:00","updated_at":"2026-07-05T11:26:38.860979+00:00"}