{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2022:RGBKVJBHLOBEX43TKFDEP6BCDE","short_pith_number":"pith:RGBKVJBH","schema_version":"1.0","canonical_sha256":"8982aaa4275b824bf373514647f8221910244d86448b1cb9a563a50ca26a2244","source":{"kind":"arxiv","id":"2203.13131","version":1},"attestation_state":"computed","paper":{"title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.GR","cs.LG"],"primary_cat":"cs.CV","authors_text":"Adam Polyak, Devi Parikh, Oran Gafni, Oron Ashual, Shelly Sheynin, Yaniv Taigman","submitted_at":"2022-03-24T15:44:50Z","abstract_excerpt":"Recent text-to-image generation methods provide a simple yet exciting conversion capability between text and image domains. While these methods have incrementally improved the generated image fidelity and text relevancy, several pivotal gaps remain unanswered, limiting applicability and quality. We propose a novel text-to-image method that addresses these gaps by (i) enabling a simple control mechanism complementary to text in the form of a scene, (ii) introducing elements that substantially improve the tokenization process by employing domain-specific knowledge over key image regions (faces a"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2203.13131","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2022-03-24T15:44:50Z","cross_cats_sorted":["cs.AI","cs.CL","cs.GR","cs.LG"],"title_canon_sha256":"ec03fce5fdb1dd0987f9c72289681d44d2c6e954af29f096a8f852cd8c20b740","abstract_canon_sha256":"20b96b24df55ab3efc817efae4ec61eb91176c7541bc1edd42eb20a824349d2c"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T04:08:21.008526Z","signature_b64":"ep1Ap4DuBUN+3weqCkG/zi1nmL/IY8TagAXAyKvfhx3tjY+Ala721URdrAfU5d/bc6YVkfbg5y4qylIsJFfiBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8982aaa4275b824bf373514647f8221910244d86448b1cb9a563a50ca26a2244","last_reissued_at":"2026-07-05T04:08:21.008048Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T04:08:21.008048Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Make-A-Scene: Scene-Based Text-to-Image Generation with Human Priors","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL","cs.GR","cs.LG"],"primary_cat":"cs.CV","authors_text":"Adam Polyak, Devi Parikh, Oran Gafni, Oron Ashual, Shelly Sheynin, Yaniv Taigman","submitted_at":"2022-03-24T15:44:50Z","abstract_excerpt":"Recent text-to-image generation methods provide a simple yet exciting conversion capability between text and image domains. While these methods have incrementally improved the generated image fidelity and text relevancy, several pivotal gaps remain unanswered, limiting applicability and quality. We propose a novel text-to-image method that addresses these gaps by (i) enabling a simple control mechanism complementary to text in the form of a scene, (ii) introducing elements that substantially improve the tokenization process by employing domain-specific knowledge over key image regions (faces a"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2203.13131","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2203.13131/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2203.13131","created_at":"2026-07-05T04:08:21.008105+00:00"},{"alias_kind":"arxiv_version","alias_value":"2203.13131v1","created_at":"2026-07-05T04:08:21.008105+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2203.13131","created_at":"2026-07-05T04:08:21.008105+00:00"},{"alias_kind":"pith_short_12","alias_value":"RGBKVJBHLOBE","created_at":"2026-07-05T04:08:21.008105+00:00"},{"alias_kind":"pith_short_16","alias_value":"RGBKVJBHLOBEX43T","created_at":"2026-07-05T04:08:21.008105+00:00"},{"alias_kind":"pith_short_8","alias_value":"RGBKVJBH","created_at":"2026-07-05T04:08:21.008105+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":12,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2605.25343","citing_title":"Toward Native Multimodal Modeling: A Roadmap","ref_index":181,"is_internal_anchor":false},{"citing_arxiv_id":"2308.08089","citing_title":"DragNUWA: Fine-grained Control in Video Generation by Integrating Text, Image, and Trajectory","ref_index":244,"is_internal_anchor":false},{"citing_arxiv_id":"2305.02463","citing_title":"Shap-E: Generating Conditional 3D Implicit Functions","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2211.01324","citing_title":"eDiff-I: Text-to-Image Diffusion Models with an Ensemble of Expert Denoisers","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2205.11487","citing_title":"Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding","ref_index":22,"is_internal_anchor":false},{"citing_arxiv_id":"2206.10789","citing_title":"Scaling Autoregressive Models for Content-Rich Text-to-Image Generation","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2112.10752","citing_title":"High-Resolution Image Synthesis with Latent Diffusion Models","ref_index":26,"is_internal_anchor":false},{"citing_arxiv_id":"2405.09818","citing_title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","ref_index":9,"is_internal_anchor":false},{"citing_arxiv_id":"2304.08485","citing_title":"Visual Instruction Tuning","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2208.01626","citing_title":"Prompt-to-Prompt Image Editing with Cross Attention Control","ref_index":13,"is_internal_anchor":false},{"citing_arxiv_id":"2209.14792","citing_title":"Make-A-Video: Text-to-Video Generation without Text-Video Data","ref_index":4,"is_internal_anchor":false},{"citing_arxiv_id":"2204.06125","citing_title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","ref_index":17,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE","json":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE.json","graph_json":"https://pith.science/api/pith-number/RGBKVJBHLOBEX43TKFDEP6BCDE/graph.json","events_json":"https://pith.science/api/pith-number/RGBKVJBHLOBEX43TKFDEP6BCDE/events.json","paper":"https://pith.science/paper/RGBKVJBH"},"agent_actions":{"view_html":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE","download_json":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE.json","view_paper":"https://pith.science/paper/RGBKVJBH","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2203.13131&json=true","fetch_graph":"https://pith.science/api/pith-number/RGBKVJBHLOBEX43TKFDEP6BCDE/graph.json","fetch_events":"https://pith.science/api/pith-number/RGBKVJBHLOBEX43TKFDEP6BCDE/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE/action/timestamp_anchor","attest_storage":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE/action/storage_attestation","attest_author":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE/action/author_attestation","sign_citation":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE/action/citation_signature","submit_replication":"https://pith.science/pith/RGBKVJBHLOBEX43TKFDEP6BCDE/action/replication_record"}},"created_at":"2026-07-05T04:08:21.008105+00:00","updated_at":"2026-07-05T04:08:21.008105+00:00"}