{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:PKWXCOSB2FJWJCHI2DWZLJMAJQ","short_pith_number":"pith:PKWXCOSB","schema_version":"1.0","canonical_sha256":"7aad713a41d1536488e8d0ed95a5804c3d13af1ea733d5ff650ffa9e487853a7","source":{"kind":"arxiv","id":"2505.22525","version":1},"attestation_state":"computed","paper":{"title":"Thinking with Generated Images","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Ethan Chern, Jiadi Su, Pengfei Liu, Siqi Kou, Steffi Chern, Yan Ma, Zhijie Deng, Zhulin Hu","submitted_at":"2025-05-28T16:12:45Z","abstract_excerpt":"We present Thinking with Generated Images, a novel paradigm that fundamentally transforms how large multimodal models (LMMs) engage with visual reasoning by enabling them to natively think across text and vision modalities through spontaneous generation of intermediate visual thinking steps. Current visual reasoning with LMMs is constrained to either processing fixed user-provided images or reasoning solely through text-based chain-of-thought (CoT). Thinking with Generated Images unlocks a new dimension of cognitive capability where models can actively construct intermediate visual thoughts, c"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.22525","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.CV","submitted_at":"2025-05-28T16:12:45Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"ff8d5e6e30fb05c1cf5b03b39ee23bbc63994681644f396bf4506f6a48416b24","abstract_canon_sha256":"6d501dcb2c2474754c0e501fd55b15b38cf1f6811b9ec6403d3c62f2fcae4837"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:11:26.031133Z","signature_b64":"OdOn4KGcSeYOoT4O0E9JeTGaFfZCofn1LdoHRumWqn1UKBQ8PQQ54As0Tr0P+UQlJoB7fQbF2vFcUnBfCqo2Bw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7aad713a41d1536488e8d0ed95a5804c3d13af1ea733d5ff650ffa9e487853a7","last_reissued_at":"2026-07-05T11:11:26.030623Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:11:26.030623Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Thinking with Generated Images","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Ethan Chern, Jiadi Su, Pengfei Liu, Siqi Kou, Steffi Chern, Yan Ma, Zhijie Deng, Zhulin Hu","submitted_at":"2025-05-28T16:12:45Z","abstract_excerpt":"We present Thinking with Generated Images, a novel paradigm that fundamentally transforms how large multimodal models (LMMs) engage with visual reasoning by enabling them to natively think across text and vision modalities through spontaneous generation of intermediate visual thinking steps. Current visual reasoning with LMMs is constrained to either processing fixed user-provided images or reasoning solely through text-based chain-of-thought (CoT). Thinking with Generated Images unlocks a new dimension of cognitive capability where models can actively construct intermediate visual thoughts, c"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.22525","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.22525/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.22525","created_at":"2026-07-05T11:11:26.030685+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.22525v1","created_at":"2026-07-05T11:11:26.030685+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.22525","created_at":"2026-07-05T11:11:26.030685+00:00"},{"alias_kind":"pith_short_12","alias_value":"PKWXCOSB2FJW","created_at":"2026-07-05T11:11:26.030685+00:00"},{"alias_kind":"pith_short_16","alias_value":"PKWXCOSB2FJWJCHI","created_at":"2026-07-05T11:11:26.030685+00:00"},{"alias_kind":"pith_short_8","alias_value":"PKWXCOSB","created_at":"2026-07-05T11:11:26.030685+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":16,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.25319","citing_title":"V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning","ref_index":58,"is_internal_anchor":false},{"citing_arxiv_id":"2606.26969","citing_title":"Einstein World Models","ref_index":28,"is_internal_anchor":false},{"citing_arxiv_id":"2606.17557","citing_title":"Universal Image Restoration via Internalized Chain-of-Thought Reasoning","ref_index":36,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12886","citing_title":"Bridging Modal Isolation in Interleaved Thinking: Supervising Modality Transitions via Stepwise Reinforcement","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2606.08063","citing_title":"Robust-U1: Can MLLMs Self-Recover Corrupted Visual Content for Robust Understanding?","ref_index":1,"is_internal_anchor":false},{"citing_arxiv_id":"2606.00562","citing_title":"DeepLatent: Think with Images via Parallel Latent Visual Reasoning","ref_index":65,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10941","citing_title":"Mull-Tokens: Modality-Agnostic Latent Thinking","ref_index":14,"is_internal_anchor":false},{"citing_arxiv_id":"2601.09536","citing_title":"Omni-R1: Towards the Unified Generative Paradigm for Multimodal Reasoning","ref_index":6,"is_internal_anchor":false},{"citing_arxiv_id":"2602.11731","citing_title":"Thinking with Drafting: Optical Decompression via Logical Reconstruction","ref_index":10,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12163","citing_title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10500","citing_title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.12163","citing_title":"Self-Consistent Latent Reasoning: Long Latent Sequence Reasoning for Vision-Language Model","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2503.09567","citing_title":"Towards Reasoning Era: A Survey of Long Chain-of-Thought for Reasoning Large Language Models","ref_index":130,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10500","citing_title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","ref_index":8,"is_internal_anchor":false},{"citing_arxiv_id":"2605.05781","citing_title":"Steering Visual Generation in Unified Multimodal Models with Understanding Supervision","ref_index":7,"is_internal_anchor":false},{"citing_arxiv_id":"2604.10500","citing_title":"Visual Enhanced Depth Scaling for Multimodal Latent Reasoning","ref_index":8,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ","json":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ.json","graph_json":"https://pith.science/api/pith-number/PKWXCOSB2FJWJCHI2DWZLJMAJQ/graph.json","events_json":"https://pith.science/api/pith-number/PKWXCOSB2FJWJCHI2DWZLJMAJQ/events.json","paper":"https://pith.science/paper/PKWXCOSB"},"agent_actions":{"view_html":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ","download_json":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ.json","view_paper":"https://pith.science/paper/PKWXCOSB","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.22525&json=true","fetch_graph":"https://pith.science/api/pith-number/PKWXCOSB2FJWJCHI2DWZLJMAJQ/graph.json","fetch_events":"https://pith.science/api/pith-number/PKWXCOSB2FJWJCHI2DWZLJMAJQ/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ/action/timestamp_anchor","attest_storage":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ/action/storage_attestation","attest_author":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ/action/author_attestation","sign_citation":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ/action/citation_signature","submit_replication":"https://pith.science/pith/PKWXCOSB2FJWJCHI2DWZLJMAJQ/action/replication_record"}},"created_at":"2026-07-05T11:11:26.030685+00:00","updated_at":"2026-07-05T11:11:26.030685+00:00"}