{"as_of":"2026-08-10T21:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:081f29d958c044d1daf26c37526563cdbf05f521d44429751127bf2a68dba9af","coverage":[{"denominator":69,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":69,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T10:23:43.501656Z","state":"measured"},{"denominator":69,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":69,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.04264/citation-record","integrity":"/paper/2606.04264/integrity","json":"/paper/2606.04264/citation-record.json","paper":"/paper/2606.04264"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":"2502.13923","doi":"10.48550/arxiv.2502.13923","metadata_source":"pith","pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen2.5-VL Technical Report","venue":"cs.CV","work_id":"69dffacb-bfe8-442d-be86-48624c60426f","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:45bd2d57427c5920b118402bd36d4def91ada0acc9bd0777faf91c25e59e62d7","observation_id":"ae7a97a6-e716-4f44-bf1f-79e6625f9a38","resolution":{"observed_at":"2026-07-02T03:06:29.566595Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T16:08:16.864468+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: Proceedings of the Computer Vision and Pattern Recognition Con- ference","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:998b5ae38e5ee922829d8f562546647061d7d564c6b6cb1453dbf9628b903d40","observation_id":"f3e6aa21-e713-40fd-beb6-3c0cfb76cf7d","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.02227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.239816Z","title":"Show, don’t tell: Morphing latent reasoning into image generation","venue":null,"work_id":"b2d90d37-ba5a-42f2-8d9f-abc39922218a","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:80110f5f9cdc12ed6e94733f968ebd671d6395264ae91dee88ab378aff5ada20","observation_id":"9b1deed4-1123-4032-8db7-38b6d69b0b3b","resolution":{"observed_at":"2026-07-02T03:06:29.548371Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09568","last_updated":"2025-05-14T17:11:07Z","snapshot_observed_at":"2026-07-06T21:23:57.084147Z","submitted_at":"2025-05-14T17:11:07Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","version":1},"cited_work":{"arxiv_id":"2505.09568","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.09568","snapshot_observed_at":"2026-07-08T00:04:22.585543Z","title":"BLIP3-o: A Family of Fully Open Unified Multimodal Models-Architecture, Training and Dataset","venue":"cs.CV","work_id":"86d896d2-592f-4d9b-938e-dfeb11f9388f","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.09568","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:6155bbb336ea3815911ab225c77150c525c3e09a41ed64065cfe7a7686fec11e","observation_id":"c528c30b-c05b-438e-b637-77a36c5a076a","resolution":{"observed_at":"2026-07-02T03:06:29.539468Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00426","last_updated":"2023-12-29T16:42:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-30T16:18:00Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","version":3},"cited_work":{"arxiv_id":"2310.00426","doi":"10.48550/arxiv.2310.00426","metadata_source":"pith","pith_arxiv_id":"2310.00426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"PixArt-$\\alpha$: Fast Training of Diffusion Transformer for Photorealistic Text-to-Image Synthesis","venue":"cs.CV","work_id":"77157568-e4be-4041-bb20-388177fc59d0","year":2023},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2310.00426","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:252cd5c26de6f3bc79bd25dff3a05acf87c8957432a08161bced70d088c6b154","observation_id":"f0e0db20-42fd-4e0c-9467-3b005188e681","resolution":{"observed_at":"2026-07-02T03:06:29.559437Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:49:58.428012+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06135","last_updated":"2024-07-08T17:08:02Z","snapshot_observed_at":"2026-08-09T05:47:14.092221Z","submitted_at":"2024-07-08T17:08:02Z","title":"ANOLE: An Open, Autoregressive, Native Large Multimodal Models for Interleaved Image-Text Generation","version":1},"cited_work":{"arxiv_id":"2407.06135","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.06135","snapshot_observed_at":"2026-07-04T16:29:56.712695Z","title":"Anole: An open, autoregressive, native large multimodal models for interleaved image-text generation","venue":null,"work_id":"31ce9d99-2071-41a0-9f51-51b8c5e3ba7e","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2407.06135","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:26aa26d5f4b46cdd43cb1113ccdf8747f89a64685575d4a6e58ec94dc5fd0328","observation_id":"bfe18290-46dd-4369-b218-fcd1ebcb5253","resolution":{"observed_at":"2026-07-02T03:06:29.571000Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:5f988435726611264378cf85e91c50c9cdab97c42170201c72d84f41789ab98d","observation_id":"70a67ce8-bb71-4b32-9176-df6bd433ff6d","resolution":{"observed_at":"2026-07-02T03:06:29.567184Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"Advances in neural information processing systems34, 8780–8794 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:481b7d15d59d2d8149ce4573bb04c46987bc16e0339f47bb6a74b8956a4e49be","observation_id":"7c6c606e-68b6-4ccc-ba07-b40f4442edbf","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11499","last_updated":"2024-03-15T19:19:28Z","snapshot_observed_at":"2026-08-07T22:11:51.327954Z","submitted_at":"2023-09-20T17:58:05Z","title":"DreamLLM: Synergistic Multimodal Comprehension and Creation","version":2},"cited_work":{"arxiv_id":"2309.11499","doi":"10.48550/arxiv.2309.11499","metadata_source":"arxiv_reference","pith_arxiv_id":"2309.11499","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dreamllm: Synergistic multimodal comprehension and creation","venue":"arXiv (Cornell University)","work_id":"43128e8d-8204-43b8-9bfc-f0da0b15ed39","year":2023},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2309.11499","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:87d40f68d17d4bda7f221a30a15294e3034e20eebb5409d72a1adb6f461facb0","observation_id":"094f7303-a6cd-4d0c-b58c-f37abd8c2d9c","resolution":{"observed_at":"2026-07-02T03:06:29.585749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.17022","last_updated":"2026-04-12T04:05:04Z","snapshot_observed_at":"2026-07-06T21:28:43.610849Z","submitted_at":"2025-05-22T17:59:58Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","version":2},"cited_work":{"arxiv_id":"2505.17022","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.17022","snapshot_observed_at":"2026-07-04T16:39:58.241853Z","title":"GoT-R1: Unleashing Reasoning Capability of MLLM for Visual Generation with Reinforcement Learning","venue":"cs.CV","work_id":"b2fba730-5ab1-403b-aa1f-8dffe2424629","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.17022","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:6d3babe1b740f4348c805516febee36f151a4e17f9ae982ccd0d1544fb418a01","observation_id":"47ed9e8d-6ae9-486a-b062-8ba11c7620fc","resolution":{"observed_at":"2026-07-02T03:06:29.575568Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: Forty-first international confer- ence on machine learning (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:0c8535808adf2f2e8fc25dcbbcd3e97a80967723ecfb5f2a852df1c7bb5f0015","observation_id":"5877e331-b0f2-40e5-b34f-ac22629605fe","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05945","last_updated":"2024-06-13T11:13:39Z","snapshot_observed_at":"2026-07-06T18:12:13.931421Z","submitted_at":"2024-05-09T17:35:16Z","title":"Lumina-T2X: Transforming Text into Any Modality, Resolution, and Duration via Flow-based Large Diffusion Transformers","version":3},"cited_work":{"arxiv_id":"2405.05945","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.05945","snapshot_observed_at":"2026-07-04T16:59:58.189803Z","title":"Lumina-t2x: Transforming text into any modality, resolution, and duration via flow-based large diffusion transformers","venue":null,"work_id":"236b1566-5e13-464f-89a2-cae7ec249825","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2405.05945","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:eef99543c2a37b49b49066736b11bc8bc82e5d1a0c545a35e7d3a3abe883b8e7","observation_id":"80f432bc-4c07-4351-a531-359f6798c77f","resolution":{"observed_at":"2026-07-02T03:06:29.553020Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.18938","last_updated":"2025-06-02T14:37:52Z","snapshot_observed_at":"2026-08-10T09:00:00.182529Z","submitted_at":"2025-03-24T17:58:15Z","title":"AdaWorld: Learning Adaptable World Models with Latent Actions","version":4},"cited_work":{"arxiv_id":"2503.18938","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2503.18938","snapshot_observed_at":"2026-07-04T11:29:50.791557Z","title":"Adaworld: Learning adaptable world models with latent actions","venue":null,"work_id":"6c8e07c6-a0ca-44a1-abe4-13e96edab7b2","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2503.18938","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:10f1bcbfb484d3bc1c0eb1e62b224e31199fcb54940c304989ffa0b5373b4cc1","observation_id":"6f90cd72-d9aa-40b4-b4db-5dc51e6b16e4","resolution":{"observed_at":"2026-07-02T03:06:29.534534Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.27492","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:37:06.844147Z","title":"Thinkmorph: Emergent properties in multimodal interleaved chain-of-thought reasoning","venue":null,"work_id":"03da248b-c710-48de-9cdc-1345fcfa31f4","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:c36d2c7680e9d212bdad76168dcbf5e9820e432ced12dbd55d7d6a2cdcc0f616","observation_id":"6a7cfd64-7b34-49e5-961d-1f152a81f8c5","resolution":{"observed_at":"2026-07-02T03:06:29.582230Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.16671","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.244888Z","title":"Thinking-while- generating: Interleaving textual reasoning throughout vi- sual generation.arXiv preprint arXiv:2511.16671, 2025a","venue":null,"work_id":"4216b182-04a6-4cc1-a898-5aaf370461c3","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:db2f4de5cff7c241950a2a8e808b45d95fefa6c608c032f51a4208b8c6714970","observation_id":"0986b970-58e0-4a48-b9d2-5ef374d3651d","resolution":{"observed_at":"2026-07-02T03:06:29.507525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.13926","last_updated":"2025-07-23T16:09:10Z","snapshot_observed_at":"2026-08-10T15:25:57.194019Z","submitted_at":"2025-01-23T18:59:43Z","title":"Can We Generate Images with CoT? Let's Verify and Reinforce Image Generation Step by Step","version":2},"cited_work":{"arxiv_id":"2501.13926","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13926","snapshot_observed_at":"2026-07-04T16:39:58.175257Z","title":"Can we generate images with cot? let’s verify and reinforce image generation step by step","venue":null,"work_id":"42bc4633-5505-4914-a32c-2e3d11cc6e03","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2501.13926","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:790bd9f028d99761d6110ab542a76decdea125cc2b78ba208884813567428114","observation_id":"aafb7341-2c9b-4aa3-a2c7-b6e392123764","resolution":{"observed_at":"2026-07-02T03:06:29.520773Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.10122","last_updated":"2018-05-09T09:06:27Z","snapshot_observed_at":"2026-07-31T21:36:45.596575Z","submitted_at":"2018-03-27T15:08:55Z","title":"World Models","version":4},"cited_work":{"arxiv_id":"1803.10122","doi":"10.48550/arxiv.1712.00409","metadata_source":"pith","pith_arxiv_id":"1803.10122","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Models","venue":"cs.LG","work_id":"07227eee-8445-4c98-bce4-c6a6fd5ed907","year":2018},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/1803.10122","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:be9b8747cad2f85dbbacab5828fa0d7d94ffc60ddf43cae3c6219b06cf4cf499","observation_id":"b664f2f0-9294-4396-9ddc-0f0947df1b26","resolution":{"observed_at":"2026-07-02T03:06:29.592911Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01603","last_updated":"2020-03-17T17:10:58Z","snapshot_observed_at":"2026-08-09T02:21:17.479736Z","submitted_at":"2019-12-03T18:57:16Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","version":3},"cited_work":{"arxiv_id":"1912.01603","doi":"10.48550/arxiv.1912.01603","metadata_source":"pith","pith_arxiv_id":"1912.01603","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Dream to Control: Learning Behaviors by Latent Imagination","venue":"cs.LG","work_id":"5103f4be-344a-4139-8504-eaa59f5bac9d","year":2019},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/1912.01603","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:a6cbce822939f8048be159eb69dd1c9b3dd52858a78df56a8762eb116228add5","observation_id":"32a4cfd5-cd0e-4da7-8b66-8cbf9793f918","resolution":{"observed_at":"2026-07-02T03:06:29.542661Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.03193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:39:51.536686Z","title":"Unicorn: Towards self-improving unified multimodal models through self- generated supervision.arXiv preprint arXiv:2601.03193","venue":null,"work_id":"b9ffd395-f28d-4fdb-87e4-ea7234f16ed1","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:ab48b77aaa986eee3a7151e2d295685f033fc2be29b1cdee8d50802bc6e6a2b5","observation_id":"0500a625-4ba1-4266-85ec-7cbd6983dfff","resolution":{"observed_at":"2026-07-02T03:06:29.441036Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: Advances in Neural Information Processing Systems (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:3e5f6beadf5a0b96bf9fcd36ce91d2a1b978ddaa8321e70864ff136f6830c1cc","observation_id":"bbdb05bf-ec04-4638-a7a3-db54f6b51430","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.12598","last_updated":"2022-07-26T01:42:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-07-26T01:42:07Z","title":"Classifier-Free Diffusion Guidance","version":1},"cited_work":{"arxiv_id":"2207.12598","doi":"10.1109/cvpr52733.2024.02494","metadata_source":"pith","pith_arxiv_id":"2207.12598","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Classifier-Free Diffusion Guidance","venue":"cs.LG","work_id":"acf2c588-c088-4a6c-938e-150ad7c666d7","year":2022},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2207.12598","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:4673d5a1c600a70c3d7f336650c2692080af903c2c0f01d3174a6472c9b32d51","observation_id":"a6645927-226f-4371-ae94-11dea5f5c1e9","resolution":{"observed_at":"2026-07-02T03:06:29.533665Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"IEEE Robotics and Automation Letters5(2), 3019–3026 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:0c0369b5b47276dc5c06658557e8e1642a59b93109fa404450d538abfcb84081","observation_id":"8518f4d6-fe6e-4352-b729-87ace7b4ed5b","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.00703","last_updated":"2025-07-01T11:46:57Z","snapshot_observed_at":"2026-08-07T20:35:00.460457Z","submitted_at":"2025-05-01T17:59:46Z","title":"T2I-R1: Reinforcing Image Generation with Collaborative Semantic-level and Token-level CoT","version":2},"cited_work":{"arxiv_id":"2505.00703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.00703","snapshot_observed_at":"2026-07-04T13:29:50.900451Z","title":"T2i-r1: Reinforcing image generation with collaborative semantic-level and token-level cot","venue":null,"work_id":"8ee83e43-3a92-48b9-8551-c7853487c9f0","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.00703","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:8364e7fb985b12f21c804f76952ba8f5dbe3cae8fd6fadcea70462c01aac5254","observation_id":"4e41e694-401b-4ea4-a1c0-b39ec79e72f4","resolution":{"observed_at":"2026-07-02T03:06:29.453307Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.05112","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T16:39:58.248083Z","title":"Draco: Draft as cot for text-to-image preview and rare concept generation","venue":null,"work_id":"d6e83664-18b0-46f4-8cf6-0583acac00c0","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:a60fcfa47cfb036a2674dc45ac5310ea1cbe32b4e494b88c6de8eb833787b2f6","observation_id":"364bed1f-510d-476b-aa6f-089093e51c26","resolution":{"observed_at":"2026-07-02T03:06:29.597193Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.17534","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T03:06:29.587224Z","title":"Co-reinforcement learning for unified multimodal understanding and generation","venue":null,"work_id":"9357edd6-cbc8-45ff-a420-49cc432d1524","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:ebb8f533b138ce16228cc4d57b5bed0184baea88fc6436dd7cf1ac21c9495a9b","observation_id":"1517d4da-aaf5-4c34-9af0-062175169ba4","resolution":{"observed_at":"2026-07-02T03:06:29.588932Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"Advances in neural information process- ing systems35, 26565–26577 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:c0366754a3b0543a1333395885a7fe57c0272ac9f4dcf0738609a35210aea1c8","observation_id":"6b582f28-6385-49bf-be00-bf52174212e9","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"Advances in neural information processing systems34, 21696–21707 (2021)","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:4a3d1ed9af74a31ef33be95d7c67a7d5e2e11416196e24d1e1139df4a4574b6f","observation_id":"5cc6122f-c3c7-405e-b5d5-c6111f103c9d","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07542","last_updated":"2025-01-13T18:23:57Z","snapshot_observed_at":"2026-08-02T11:23:33.987927Z","submitted_at":"2025-01-13T18:23:57Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","version":1},"cited_work":{"arxiv_id":"2501.07542","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.07542","snapshot_observed_at":"2026-07-10T13:37:06.824298Z","title":"Imagine while Reasoning in Space: Multimodal Visualization-of-Thought","venue":"cs.CL","work_id":"fe549c4a-19fa-421a-9a30-230932ba737e","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2501.07542","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:f4b5df8c641f9219d6688217a6080245d90678e9f24a87317608fb0e73b02dcc","observation_id":"0a89f193-74e6-4fb1-bbba-d4a4be71e2d7","resolution":{"observed_at":"2026-07-02T03:06:29.480653Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21998","last_updated":"2026-03-22T15:37:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-01-29T17:07:43Z","title":"Causal World Modeling for Robot Control","version":2},"cited_work":{"arxiv_id":"2601.21998","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21998","snapshot_observed_at":"2026-07-10T12:47:05.502321Z","title":"Causal World Modeling for Robot Control","venue":"cs.CV","work_id":"a33c4ee0-db06-4f9a-8852-c62e3a72fc27","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2601.21998","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:98945e1508a37c4e852336e03b125e496bec9588fcc0c33d7df6be047daae66e","observation_id":"60030a6d-a422-41b1-aeec-878c0af925a0","resolution":{"observed_at":"2026-07-02T03:06:29.604172Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05635","last_updated":"2025-11-04T12:01:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-08-07T17:59:44Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","version":3},"cited_work":{"arxiv_id":"2508.05635","doi":"10.48550/arxiv.2508.05635","metadata_source":"pith","pith_arxiv_id":"2508.05635","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Genie Envisioner: A Unified World Foundation Platform for Robotic Manipulation","venue":"cs.RO","work_id":"440ad435-44ba-4acd-9aeb-21dd3ee04835","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2508.05635","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:d71ff1ffadd9f380140dcddececa81a40fb1029676bb588585eb38e71ca91803","observation_id":"f68e8e09-fdd2-4091-9d33-9828d4d24719","resolution":{"observed_at":"2026-07-02T03:06:29.499211Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: NeurIPS (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:eb93f3f903b248faf6bb8be68c83d4befc312c6980b2f9e42dcb850c7839b67d","observation_id":"92ae4fb1-18b5-4653-b5c0-32b1946bd869","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2502.20321","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.827602Z","title":"Unitok: A unified tokenizer for visual generation and understanding.arXiv preprint arXiv:2502.20321, 2025a","venue":null,"work_id":"31d5c278-398d-4fee-8130-a864fb6b3717","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:21d6b7e6a88efe2454ccc70de49e73b58f0776900ad168dccc9507ab3b14284c","observation_id":"10d35a61-b93b-442a-a6f5-cf6ebce8b372","resolution":{"observed_at":"2026-07-02T03:06:29.529581Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07975","last_updated":"2025-03-24T08:33:32Z","snapshot_observed_at":"2026-08-10T17:11:09.825158Z","submitted_at":"2024-11-12T17:55:10Z","title":"JanusFlow: Harmonizing Autoregression and Rectified Flow for Unified Multimodal Understanding and Generation","version":2},"cited_work":{"arxiv_id":"2411.07975","doi":"10.48550/arxiv.2411.07975","metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07975","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2025.doi:10.48550/arXiv.2411.07975","venue":"arXiv (Cornell University)","work_id":"57d73d19-7fb3-40ec-aa67-42c6d678ec43","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2411.07975","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:bc10fcce5f69bdc25fb57bca6becb6e299344030a30b92947f7c0b12756f4eeb","observation_id":"b4913942-e06f-4c3d-9ffd-70df057d8e48","resolution":{"observed_at":"2026-07-02T03:06:29.475775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: International conference on machine learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:cffb7d874dd37130268ad3e97c88111eec081d70f05a803db2e0b97c8d3e5edd","observation_id":"a044656e-8c97-4103-a713-dfad79292136","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.01952","last_updated":"2023-07-04T23:04:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-04T23:04:57Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","version":1},"cited_work":{"arxiv_id":"2307.01952","doi":"10.48500/arxiv.2307.01952","metadata_source":"pith","pith_arxiv_id":"2307.01952","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis","venue":"cs.CV","work_id":"8034c587-fba6-4941-87ba-c98f2ac962cb","year":2023},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2307.01952","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:7db78a6ea87f855206a110f598411aa5c0417018bae3f62b2f82d97c5b7895ce","observation_id":"ea36146c-2f6d-451b-85d9-e64082d4ca1b","resolution":{"observed_at":"2026-07-02T03:06:29.457737Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.07313","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T21:58:58.439948Z","title":"arXiv preprint arXiv:2510.07313 (2025)","venue":null,"work_id":"a9c7d963-ec81-43eb-adaf-14a8635eeea7","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:80d65cb56b615049256c7582bfd3ad7ed387faec192d30a641fe62e96a96c7f0","observation_id":"3a6354a8-9b1c-4ca2-9942-0557b5ae1097","resolution":{"observed_at":"2026-07-02T03:06:29.468681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2508.05606","doi":"10.48550/arxiv.2508.05606","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Uni-cot: Towards unified chain-of-thought reasoning across text and vision.arXiv preprint arXiv:2508.05606","venue":"arXiv (Cornell University)","work_id":"2d7c3351-90a7-45ce-a374-890c71fbea6e","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:4449c52041825d07dac4c425beb1d8eec05c760bf08f2cb1d2a95d42de929fc3","observation_id":"c67e72b4-edbf-429d-bd8f-80996dc335f3","resolution":{"observed_at":"2026-07-02T03:06:29.511892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06125","last_updated":"2022-04-13T01:10:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-13T01:10:33Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","version":1},"cited_work":{"arxiv_id":"2204.06125","doi":"10.48550/arxiv.2204.06125","metadata_source":"pith","pith_arxiv_id":"2204.06125","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hierarchical Text-Conditional Image Generation with CLIP Latents","venue":"cs.CV","work_id":"0c6a768b-70b8-4242-bb0e-459f1008c9fc","year":2022},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2204.06125","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:ef955293381209efad1c794a2c49facab75f019f659d2c818ed4527395044607","observation_id":"465ec9fe-d271-4ec3-ace3-945de1659d2c","resolution":{"observed_at":"2026-07-02T03:06:29.503458Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T13:50:02.412412+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: Proceedings of the IEEE/CVF conference on computer vision and pattern recognition","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:af57bb87dd8181ad4ffcbd9dd4bd756d59ebe9ba3b3e9b9dc209ce2502bb41f5","observation_id":"06d7010d-177b-4bca-a8e2-214ec9e59a7b","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"Advances in neural information processing systems35, 36479– 36494 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:0798412b6c61c97bd44c3c0f100dfc92a765b493b9c94d92e0eaa640957b8457","observation_id":"932508e1-a945-4d8f-9371-108ff7965203","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"cited_work":{"arxiv_id":"2505.23606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.23606","snapshot_observed_at":"2026-07-04T16:09:57.601747Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","venue":"cs.LG","work_id":"d9362ac2-4e03-4696-ab0c-aa7f2419766a","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.23606","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:a59699a60b4e53b73527184a7eea4bb0491e516988cc70df03a76e972fbf2959","observation_id":"ae49b2af-536e-4ec7-8d72-cf2a1aabbb55","resolution":{"observed_at":"2026-07-02T03:06:29.408322Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: Proceedings of the 32nd International Conference on Machine Learning","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:7e5e6377eca309d46051817d7b4b8a2f2175737966a730034a6d84525320d1e7","observation_id":"c7fa0d79-cfc7-41fe-b50d-1bf061b75162","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"Advances in neural information processing systems34, 1415–1428 (2021) UniCanvas: Diffusion-base Unified Model for Text-in-Image Joint Generation 27","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:6d2ef2a92c9058966c6dc744ba2ac0e9600ada99273d94601add0f570147df21","observation_id":"f92ea737-4087-4416-8475-3a3a4c6e3d01","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.13456","last_updated":"2021-02-10T18:17:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-11-26T19:39:10Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","version":2},"cited_work":{"arxiv_id":"2011.13456","doi":"10.1088/1748-9326/aae98d","metadata_source":"pith","pith_arxiv_id":"2011.13456","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Score-Based Generative Modeling through Stochastic Differential Equations","venue":"cs.LG","work_id":"d9110e53-a5d4-4794-a4c5-a575e91c31ad","year":2020},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2011.13456","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:7d721b4ff8b822003d39035dadc68c78dbaad4d63f087c97127e942e941dc5a0","observation_id":"73f7e765-0833-4779-a4ca-35536a43a67b","resolution":{"observed_at":"2026-07-02T03:06:29.529458Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"crossref_status_cache"},{"observed_at":"2026-06-01T22:58:00.812405+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2601.21406","last_updated":"2026-05-25T11:24:48Z","snapshot_observed_at":"2026-08-03T07:03:10.947402Z","submitted_at":"2026-01-29T08:42:25Z","title":"Generation Enhances Understanding in Unified Multimodal Models via Multi-Representation Generation","version":3},"cited_work":{"arxiv_id":"2601.21406","doi":null,"metadata_source":"pith","pith_arxiv_id":"2601.21406","snapshot_observed_at":"2026-07-02T03:06:29.598538Z","title":"Generation enhances understanding in unified multimodal models via multi-representation generation","venue":"cs.CV","work_id":"4f28bb7c-82b5-411d-960b-062463f42276","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2601.21406","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:21e59946a256f18a3c5455f5259413f835be715b1e4c065e1e7c40f3eb5b34fc","observation_id":"3b2abf4f-2aa1-47f9-9a11-80e9d55834c1","resolution":{"observed_at":"2026-07-02T03:06:29.600947Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-08-09T20:05:31.409634Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:69b9456e69540878517e8a95c6b415c35fcb53b097e1687c0403dc762c26d2b7","observation_id":"39ebde8e-370e-4b84-b3f5-9509fdb7be11","resolution":{"observed_at":"2026-07-02T03:06:29.498536Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05963","last_updated":"2026-05-25T15:53:24Z","snapshot_observed_at":"2026-08-08T22:18:33.888125Z","submitted_at":"2025-11-08T10:41:26Z","title":"Next-Latent Prediction Transformers Learn Compact World Models","version":3},"cited_work":{"arxiv_id":"2511.05963","doi":null,"metadata_source":"pith","pith_arxiv_id":"2511.05963","snapshot_observed_at":"2026-07-02T12:26:56.594194Z","title":"Next-Latent Prediction Transformers Learn Compact World Models","venue":"cs.LG","work_id":"01242f65-5017-41a7-ad26-701ec4daf469","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2511.05963","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:504de0a9ee51f40fed5c5f3f31b69740cf6eb48d68f18a1df5e00fd4734113d4","observation_id":"19dadc12-d78e-448a-8d84-d4f116ea6a92","resolution":{"observed_at":"2026-07-02T03:06:29.434904Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10208","last_updated":"2024-04-02T09:20:50Z","snapshot_observed_at":"2026-08-10T06:38:09.395526Z","submitted_at":"2024-01-18T18:50:16Z","title":"MM-Interleaved: Interleaved Image-Text Generative Modeling via Multi-modal Feature Synchronizer","version":2},"cited_work":{"arxiv_id":"2401.10208","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2401.10208","snapshot_observed_at":"2026-07-02T03:06:29.513473Z","title":"Mm-interleaved: Interleaved image-text generative modeling via multi-modal feature synchronizer","venue":null,"work_id":"e1e87b1d-1e77-40b8-b606-a74fd08a4f4c","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2401.10208","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:f02fa63c80827d56dd00ded353a86e9f726006e3830d20f014b3d923641ab522","observation_id":"3bff77f8-fabd-4154-9dd9-2c0556a56736","resolution":{"observed_at":"2026-07-02T03:06:29.515827Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14164","last_updated":"2024-12-18T18:58:50Z","snapshot_observed_at":"2026-08-08T15:05:21.947334Z","submitted_at":"2024-12-18T18:58:50Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","version":1},"cited_work":{"arxiv_id":"2412.14164","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14164","snapshot_observed_at":"2026-07-04T10:09:44.713840Z","title":"MetaMorph: Multimodal Understanding and Generation via Instruction Tuning","venue":"cs.CV","work_id":"cc1e25c3-90c2-4e87-9268-d28d48c546a1","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2412.14164","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:b7a925f1575298a34f618f74913cdf64ad18ce1ca1fa957a072b599fac5a848b","observation_id":"560668b8-fa32-46fb-9460-09c127905331","resolution":{"observed_at":"2026-07-02T03:06:29.520043Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.01382","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:19:49.606655Z","title":"Promptrl: Prompt matters in rl for flow-based image generation","venue":null,"work_id":"4762b3e3-3543-475a-abb8-366e9d2e78bc","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:38c543800a72d5f4d05c62a06ec3d253b4b5b650679b6f55569abb57bffba0a8","observation_id":"63aaf219-5335-4093-900a-5a34697599fc","resolution":{"observed_at":"2026-07-02T03:06:29.431227Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20147","last_updated":"2025-07-24T05:31:36Z","snapshot_observed_at":"2026-08-08T06:11:49.265407Z","submitted_at":"2025-05-26T15:46:53Z","title":"FUDOKI: Discrete Flow-based Unified Understanding and Generation via Kinetic-Optimal Velocities","version":3},"cited_work":{"arxiv_id":"2505.20147","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.20147","snapshot_observed_at":"2026-07-05T11:41:02.728596Z","title":"FUDOKI: Discrete flow-based unified understanding and generation via kinetic-optimal velocities","venue":null,"work_id":"69def97c-6b34-442e-bb6f-53741695848c","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.20147","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:ec106fe9baf6e27614e53447b9bbed62cfe9cd38e323e5578a881b1f2ec6ec71","observation_id":"2d614183-073a-40d1-b8dc-a1449344745d","resolution":{"observed_at":"2026-07-02T03:06:29.415805Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07199","last_updated":"2025-04-28T14:16:29Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:21:43Z","title":"OmniEdit: Building Image Editing Generalist Models Through Specialist Supervision","version":2},"cited_work":{"arxiv_id":"2411.07199","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.07199","snapshot_observed_at":"2026-07-08T05:54:33.520626Z","title":"Omniedit: Building image edit- ing generalist models through specialist supervision","venue":"cs.CV","work_id":"97a720ba-6ad9-454d-806b-cae4a79bdcf0","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2411.07199","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:1fd7bf8b50e0d3fec54e6f1404adabd2e3f592b30063ff1f265389614de42f39","observation_id":"3f2a96d2-7e12-4b69-88e6-03684f390914","resolution":{"observed_at":"2026-07-02T03:06:29.555038Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.19834","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T13:38:19.365035Z","title":"Visual generation unlocks human-like reasoning through multimodal world models","venue":null,"work_id":"c93eb550-1241-4a65-ad81-6d0adbd24153","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:8dba358117cfaedf80e0333f7178d350687ab239843d8667c5c7f50b9d091bfc","observation_id":"d8418e6d-b70c-4c8c-8d8d-ce2017c5df22","resolution":{"observed_at":"2026-07-02T03:06:29.404589Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01863","last_updated":"2024-07-02T00:24:01Z","snapshot_observed_at":"2026-08-06T20:08:58.356364Z","submitted_at":"2024-07-02T00:24:01Z","title":"VSP: Assessing the dual challenges of perception and reasoning in spatial planning tasks for VLMs","version":1},"cited_work":{"arxiv_id":"2407.01863","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2407.01863","snapshot_observed_at":"2026-07-04T08:49:42.284484Z","title":"Vsp: Assessing the dual challenges of perception and reasoning in spatial planning tasks for vlms","venue":null,"work_id":"860f68ca-a61a-4b00-b02c-2c4753864d32","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2407.01863","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:bfb159fbf2ed954e1fb43ae0554fb767fd8b41944cdd9af56270a73d7425ef48","observation_id":"18f693bf-10c3-470e-ac10-01cef63244f4","resolution":{"observed_at":"2026-07-02T03:06:29.516632Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":"2409.04429","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-07-04T13:39:51.496167Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","venue":"cs.CV","work_id":"7039c3ef-6ce4-4c98-96ed-9eef3d669045","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:f6b59136904413e45b3ded77a2eb106ef22017a47b44bc190c815d2a1fb23221","observation_id":"111f96ee-2a70-4f09-b5a9-511d8a3cb994","resolution":{"observed_at":"2026-07-02T03:06:29.562678Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.13031","last_updated":"2025-06-11T15:44:25Z","snapshot_observed_at":"2026-08-08T10:01:09.646573Z","submitted_at":"2025-05-19T12:17:04Z","title":"MindOmni: Unleashing Reasoning Generation in Vision Language Models with RGPO","version":2},"cited_work":{"arxiv_id":"2505.13031","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.13031","snapshot_observed_at":"2026-07-02T03:06:29.440180Z","title":"Mindomni: Unleashing reasoning generation in vision language models with rgpo","venue":null,"work_id":"2dfd098c-2b10-4fe1-a491-d819f974d7d4","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.13031","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:19ac5abf93cf6b6c480145f1d77b4450650dc8d3c7859309ea107effda38f607","observation_id":"a6585bc5-4f90-46ac-91cc-5b059183f3b2","resolution":{"observed_at":"2026-07-02T03:06:29.442237Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: The Thirteenth International Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:c4e2a8ee9afce4b89237af698b9000cf01bf360c5898822a08c387bd3d32a219","observation_id":"83fb98d1-c4f9-427b-b126-9c862489be1a","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.11409","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T01:46:40.958436Z","title":"Visual planning: Let’s think only with images","venue":null,"work_id":"de8a30bf-f8d1-46d8-b619-a8e07a7503cb","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:0d94fb4959633a4174608031961059a0a2ba2af94eec0f5be8702011f1034a8f","observation_id":"39258149-5fd1-4bf4-9599-7e73c78c7313","resolution":{"observed_at":"2026-07-02T03:06:29.570311Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15809","last_updated":"2025-09-25T02:40:45Z","snapshot_observed_at":"2026-08-05T05:27:10.277230Z","submitted_at":"2025-05-21T17:59:05Z","title":"MMaDA: Multimodal Large Diffusion Language Models","version":2},"cited_work":{"arxiv_id":"2505.15809","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.15809","snapshot_observed_at":"2026-07-11T03:07:51.413936Z","title":"MMaDA: Multimodal Large Diffusion Language Models","venue":"cs.CV","work_id":"9d626cf3-094e-4960-9e71-a00a47158639","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2505.15809","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:c6d7c05b0eb29cee3a4749ef0ad7068e69a96c5d13751aecdd8d42c3eccf66d5","observation_id":"aa8649db-da31-4f93-b55e-85eee930f019","resolution":{"observed_at":"2026-07-02T03:06:29.573608Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.12508","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T03:29:30.929489Z","title":"Mindjourney: Test-time scaling with world models for spatial reasoning","venue":null,"work_id":"c1b63b60-a5d2-4ccb-ae48-129c278509a4","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:34985cfa63c026dcba60b1b55d273a591fed8721f46ab004bad89fdda5112f46","observation_id":"3cb7cb13-78ad-4b68-8ec5-f6e9d87dc1f3","resolution":{"observed_at":"2026-07-02T03:06:29.546873Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.17218","last_updated":"2025-06-20T17:59:31Z","snapshot_observed_at":"2026-08-04T13:22:36.144430Z","submitted_at":"2025-06-20T17:59:31Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","version":1},"cited_work":{"arxiv_id":"2506.17218","doi":"10.48550/arxiv.2506.17218","metadata_source":"pith","pith_arxiv_id":"2506.17218","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Machine Mental Imagery: Empower Multimodal Reasoning with Latent Visual Tokens","venue":"cs.CV","work_id":"d35f1e96-5f12-4e84-990b-e4b05852180e","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2506.17218","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:b4f258fd445554e1ee2ea456cb596440e929aaf40489eb409e73b85fbac0888a","observation_id":"63ddab03-9136-4c40-b3b6-1604641457a1","resolution":{"observed_at":"2026-07-02T03:06:29.449658Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.15922","last_updated":"2026-02-17T15:04:02Z","snapshot_observed_at":"2026-08-09T12:54:21.149243Z","submitted_at":"2026-02-17T15:04:02Z","title":"World Action Models are Zero-shot Policies","version":1},"cited_work":{"arxiv_id":"2602.15922","doi":"10.48550/arxiv.2602.15922","metadata_source":"pith","pith_arxiv_id":"2602.15922","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"World Action Models are Zero-shot Policies","venue":"cs.RO","work_id":"9a85fc69-74df-450e-94cd-69d186e9e830","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2602.15922","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:1c5bf3b1eec5d55320b3ab6c02f9e63965cd6cd4eff34212fcd64ccc5b55073a","observation_id":"e6ce7c12-2569-4435-a292-498b1b211c7a","resolution":{"observed_at":"2026-07-02T03:06:29.466690Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T21:18:49.958796+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.22625","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T13:09:50.726863Z","title":"ReasonEdit: Towards reasoning-enhanced image editing models","venue":null,"work_id":"8a697689-dad8-4795-9de8-68e8978cf9d4","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:dbedd88418956ef1e5dfb66f532217bd2f839a4fa2f92d8bf73372b7505edfb0","observation_id":"1e0ffade-cdc0-4094-8001-02d4c6d40dc7","resolution":{"observed_at":"2026-07-02T03:06:29.550865Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: Proceedings of the 33rd ACM International Conference on Mul- timedia","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:e6e1d4582bd4b5fb3f66adbbbe8c57e0fe24b0cf07232ec99f2c50de24045965","observation_id":"5e1ea126-ba6b-44f8-9c9b-0ccb131017ba","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: CVPR (2018)","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:c3641f712412308bc57c4c2f46422d32156d0fe7f404120e525eeddbe5390139","observation_id":"4f3707d0-f92b-45ca-a21c-50531d9acb59","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2602.12322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T01:57:32.224746Z","title":"Foreact: Steering your vla with efficient visual foresight planning","venue":null,"work_id":"9c8807dd-93d2-48cb-9e1b-d8292599ba77","year":2026},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:67a40e501fc3e6149a31392030f3356f01882727bf4e48561bbba728791dda28","observation_id":"975754a4-f591-4dba-a68c-5dd9242ba140","resolution":{"observed_at":"2026-07-02T03:06:29.445867Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":"2403.09631","doi":"10.48550/arxiv.2403.09631","metadata_source":"pith","pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","venue":"cs.CV","work_id":"aebf924c-e761-437e-9cee-f1ccc2e427bd","year":2024},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:4c3add437ea703109949f1667d5989c0558d690523608b6346700d99b6e4e103","observation_id":"fc6502bd-1ccb-4aa6-b95c-58b9b48bac7a","resolution":{"observed_at":"2026-07-02T03:06:29.470876Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20995","last_updated":"2025-04-29T17:59:30Z","snapshot_observed_at":"2026-08-07T15:58:07.214768Z","submitted_at":"2025-04-29T17:59:30Z","title":"TesserAct: Learning 4D Embodied World Models","version":1},"cited_work":{"arxiv_id":"2504.20995","doi":"10.48550/arxiv.2504.20995","metadata_source":"pith","pith_arxiv_id":"2504.20995","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2504.20995 (2025)","venue":"cs.CV","work_id":"3a971c23-d9fe-4291-9743-6a2b015ce29b","year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"cited_paper":"/paper/2504.20995","citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:de5f0c1641cc0c3b88388ea87732fb8dcf1fad554ab7b258166a3b671d1cc8e4","observation_id":"9d313dfa-86a2-4787-ba74-5da90799e4b6","resolution":{"observed_at":"2026-07-02T03:06:29.578809Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T10:23:43.501656Z","title":"In: The Thirteenth Inter- national Conference on Learning Representations (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T10:23:43.501656Z"},"links":{"citing_paper":"/paper/2606.04264"},"observation_digest":"sha256:af04cc64713597ee966e3f306f162c9f2391e34d686c02958b3d0241245637ad","observation_id":"73a92f2d-182f-4321-a9f6-5505505a230a","resolution":{"observed_at":"2026-06-28T10:23:43.501656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.04264","last_updated":"2026-06-02T22:30:46Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-02T22:30:46Z","title":"UniCanvas: A Diffusion-base Unified Model for Text-in-Image Joint Generation"},"reference_resolution":{"displayed":69,"state_counts":{"malformed_identifier":0,"metadata_mismatch":43,"parse_uncertain":0,"unresolved":17,"verified_exact":9,"verified_fuzzy":0},"total_outbound_references":69},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 69 of 69 outbound references and 0 inbound Pith citation observations for arXiv:2606.04264."}