{"as_of":"2026-08-12T03:42:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:aebc1c55bdfa5316e921e6d217aa75a92d11a0f3dee39ac5e2bf0cefd28e841c","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":46,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T00:56:59.639527Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T03:49:30.628376Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-12T00:56:59.639527Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.01824","last_updated":"2025-08-27T12:26:39Z","snapshot_observed_at":"2026-08-12T00:50:56.924902Z","submitted_at":"2024-12-02T18:59:26Z","title":"X-Prompt: Towards Universal In-Context Image Generation in Auto-Regressive Vision Language Foundation Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T00:56:59.639527Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.01824"},"observation_digest":"sha256:820da57b26ffba7ea53632367f63e70ce4fdbccc39a780b3a6c7be0e8d2d05d0","observation_id":"31cde6aa-6ae1-4f83-842c-bddaf0fc6804","resolution":{"observed_at":"2026-08-12T00:56:59.639527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-11T22:54:20.534492Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.03069","last_updated":"2025-08-07T09:08:33Z","snapshot_observed_at":"2026-08-11T22:45:59.824084Z","submitted_at":"2024-12-04T06:46:55Z","title":"TokenFlow: Unified Image Tokenizer for Multimodal Understanding and Generation","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-11T22:54:20.534492Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.03069"},"observation_digest":"sha256:c91473ace6d2e1f098af5102bfac241564865b54d3c8eea86613f21fc3d1b8a1","observation_id":"cd2555aa-4a88-491b-aa82-b381cddce663","resolution":{"observed_at":"2026-08-11T22:54:20.534492Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-11T19:29:52.643443Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.06673","last_updated":"2024-12-09T17:11:50Z","snapshot_observed_at":"2026-08-11T19:23:16.518889Z","submitted_at":"2024-12-09T17:11:50Z","title":"ILLUME: Illuminating Your LLMs to See, Draw, and Self-Enhance","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-11T19:29:52.643443Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.06673"},"observation_digest":"sha256:e94d8e63d966022c50d4b3f8ce85352ea0d511d1d56684aee2e2db7e151a1130","observation_id":"62571cf7-2789-4a08-865d-877163f7177c","resolution":{"observed_at":"2026-08-11T19:29:52.643443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-11T16:55:42.337407Z","title":"Lumina-mgpt: Il- luminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.09627","last_updated":"2024-12-12T18:59:59Z","snapshot_observed_at":"2026-08-11T21:10:49.410018Z","submitted_at":"2024-12-12T18:59:59Z","title":"Doe-1: Closed-Loop Autonomous Driving with Large World Model","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-11T16:55:42.337407Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.09627"},"observation_digest":"sha256:fc8d8a094aeb7a28a98c78ccf1f8f86c7d4073c052ac02278d07d1f65beacf8a","observation_id":"5dce2f0c-126c-4b86-92b1-74f7830d77bc","resolution":{"observed_at":"2026-08-11T16:55:42.337407Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-11T12:28:54.819899Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.14170","last_updated":"2024-12-19T02:42:46Z","snapshot_observed_at":"2026-08-11T12:22:31.491160Z","submitted_at":"2024-12-18T18:59:53Z","title":"E-CAR: Efficient Continuous Autoregressive Image Generation via Multistage Modeling","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-11T12:28:54.819899Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.14170"},"observation_digest":"sha256:c0fff6acb93a8ca28e5270716e8d4df5d293b7154ab0d119fefe403684556a7c","observation_id":"d5b47ab1-12f1-45d0-865a-28405a8645ea","resolution":{"observed_at":"2026-08-11T12:28:54.819899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-11T11:42:31.652085Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15119","last_updated":"2025-04-03T02:34:24Z","snapshot_observed_at":"2026-08-11T15:19:38.404584Z","submitted_at":"2024-12-19T17:59:54Z","title":"Parallelized Autoregressive Visual Generation","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-11T11:42:31.652085Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2412.15119"},"observation_digest":"sha256:8c4eec9e011cb7423e9140d2d6a6ee09ece7c93a7890e41898c8694790760914","observation_id":"d58b3ad1-85fe-452a-9860-ccbba45bc9f2","resolution":{"observed_at":"2026-08-11T11:42:31.652085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-08T15:46:22.091202Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06352","last_updated":"2025-03-27T11:53:23Z","snapshot_observed_at":"2026-08-08T15:40:35.217353Z","submitted_at":"2025-02-10T11:05:18Z","title":"LANTERN++: Enhancing Relaxed Speculative Decoding with Static Tree Drafting for Visual Auto-regressive Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-08T15:46:22.091202Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2502.06352"},"observation_digest":"sha256:866814f72caa3d5267b80d65705cae6bd2939aab18e12e1ad0fa607cbb68eee3","observation_id":"95406ae6-48ce-46d5-85ba-f8430b58703a","resolution":{"observed_at":"2026-08-08T15:46:22.091202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-08T14:26:46.753819Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06782","last_updated":"2025-02-12T10:07:07Z","snapshot_observed_at":"2026-08-08T14:18:27.556352Z","submitted_at":"2025-02-10T18:58:11Z","title":"Lumina-Video: Efficient and Flexible Video Generation with Multi-scale Next-DiT","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-08T14:26:46.753819Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2502.06782"},"observation_digest":"sha256:d38a7ab29d73c225ccbf2711715a2a4a80d684c1f576515da11df2d48a91c017","observation_id":"6fbc2086-64f5-42a4-a939-35f47d22c474","resolution":{"observed_at":"2026-08-08T14:26:46.753819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T20:21:30.454426Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.09838","last_updated":"2025-02-21T17:39:29Z","snapshot_observed_at":"2026-08-08T11:58:23.364847Z","submitted_at":"2025-02-14T00:42:36Z","title":"HealthGPT: A Medical Large Vision-Language Model for Unifying Comprehension and Generation via Heterogeneous Knowledge Adaptation","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T20:21:30.454426Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2502.09838"},"observation_digest":"sha256:7f8ba29e16e6822cc3909b8ecb7ce20682d71cbf72115da710859bf6e3d19db4","observation_id":"e773658c-3710-4996-9cd0-ffd41c0fdb40","resolution":{"observed_at":"2026-08-07T20:21:30.454426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T15:17:26.115967Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.arXiv preprint arXiv:2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.15779","last_updated":"2025-05-21T17:31:49Z","snapshot_observed_at":"2026-08-08T01:02:44.700422Z","submitted_at":"2025-05-21T17:31:49Z","title":"IA-T2I: Internet-Augmented Text-to-Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T15:17:26.115967Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.15779"},"observation_digest":"sha256:eec5cc3d4fdbfd9a89e1932839ef54c4465d44f33a4938f6605b6b07481ed748","observation_id":"26bc7693-c9e1-4dce-ab19-04882e189e26","resolution":{"observed_at":"2026-08-07T15:17:26.115967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T15:06:06.405683Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.16326","last_updated":"2025-08-04T06:14:13Z","snapshot_observed_at":"2026-08-10T07:26:23.903392Z","submitted_at":"2025-05-22T07:32:17Z","title":"ChemMLLM: Chemical Multimodal Large Language Model","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:06:06.405683Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.16326"},"observation_digest":"sha256:11a090dbb29511f41bb7f5c7774912a1dc396275e491c741f3fbe52577c4d121","observation_id":"70c81c4b-9bab-4fa5-a1e3-9800cc299360","resolution":{"observed_at":"2026-08-07T15:06:06.405683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2505.17685","last_updated":"2025-11-11T01:31:25Z","snapshot_observed_at":"2026-08-02T20:06:32.255780Z","submitted_at":"2025-05-23T09:55:32Z","title":"FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-15T19:19:42.748573Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.17685"},"observation_digest":"sha256:23e327ba0c6a6b41d0bdf628b4fc5913996981389fe4b22331b4f4be364923a8","observation_id":"f04e4ae7-fcef-48e0-92e0-93a264e8f051","resolution":{"observed_at":"2026-05-15T19:19:42.913849Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T14:16:15.891755Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.arXiv preprint arXiv:2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19602","last_updated":"2025-05-26T07:11:42Z","snapshot_observed_at":"2026-08-08T23:51:09.753030Z","submitted_at":"2025-05-26T07:11:42Z","title":"Memory-Efficient Visual Autoregressive Modeling with Scale-Aware KV Cache Compression","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:16:15.891755Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.19602"},"observation_digest":"sha256:92e4a78ee1ec2d9259dbc106d20e0762798f959e7d3115b1861c58cb990985ec","observation_id":"1adb9af2-121c-41eb-81d2-c622f8fed257","resolution":{"observed_at":"2026-08-07T14:16:15.891755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T14:09:47.643689Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.arXiv preprint arXiv:2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.19874","last_updated":"2025-05-26T12:01:15Z","snapshot_observed_at":"2026-08-07T19:22:01.250811Z","submitted_at":"2025-05-26T12:01:15Z","title":"StyleAR: Customizing Multimodal Autoregressive Model for Style-Aligned Text-to-Image Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:09:47.643689Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.19874"},"observation_digest":"sha256:6bcf6fb2ff52d88f07cf4b1053ad809ca26cd7122580f80349de02befdb81064","observation_id":"62cec599-c947-4a54-b4b7-ad3b636aa6b3","resolution":{"observed_at":"2026-08-07T14:09:47.643689Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T12:53:23.757213Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining.CoRR, abs/2408.02657, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23380","last_updated":"2025-05-29T12:00:15Z","snapshot_observed_at":"2026-08-09T02:35:27.089432Z","submitted_at":"2025-05-29T12:00:15Z","title":"UniRL: Self-Improving Unified Multimodal Models via Supervised and Reinforcement Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:53:23.757213Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.23380"},"observation_digest":"sha256:a36609dc095d665d2f8304f28ad7ccbc8b4b1193d128d450a80bd7db1d7e0b24","observation_id":"c72fe73b-cab8-499d-8243-8f62cb7fce89","resolution":{"observed_at":"2026-08-07T12:53:23.757213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2505.23606","last_updated":"2026-04-13T07:14:16Z","snapshot_observed_at":"2026-07-06T21:33:02.686798Z","submitted_at":"2025-05-29T16:15:48Z","title":"Muddit: Liberating Generation Beyond Text-to-Image with a Unified Discrete Diffusion Model","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-19T12:59:31.454155Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.23606"},"observation_digest":"sha256:a8400bd0e044f3f84032fa54f0f641c3f64aa00b946030f3aa6f2407e61b2d8f","observation_id":"d6250347-bda3-4597-adbc-03089dc1fd81","resolution":{"observed_at":"2026-05-19T13:02:18.336941Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T12:18:33.551160Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24787","last_updated":"2025-05-30T16:48:14Z","snapshot_observed_at":"2026-08-07T15:30:21.145991Z","submitted_at":"2025-05-30T16:48:14Z","title":"Draw ALL Your Imagine: A Holistic Benchmark and Agent Framework for Complex Instruction-based Image Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:33.551160Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2505.24787"},"observation_digest":"sha256:e4441e0651190ff361621622c2153fd9e8c89b5187a3b5028a01b46736af8860","observation_id":"49d3edac-ad4b-4652-88dc-a6fa4324f036","resolution":{"observed_at":"2026-08-07T12:18:33.551160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-07T05:05:00.140921Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08908","last_updated":"2025-07-10T06:20:05Z","snapshot_observed_at":"2026-08-07T20:37:15.300345Z","submitted_at":"2025-06-10T15:35:29Z","title":"SkipVAR: Accelerating Visual Autoregressive Modeling via Adaptive Frequency-Aware Skipping","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:05:00.140921Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2506.08908"},"observation_digest":"sha256:94932db7c84e693d3687dc5b2ab828c8f256507347b0dd678bf39655f7451654","observation_id":"706012d4-a61f-401b-95a4-d33aad107f67","resolution":{"observed_at":"2026-08-07T05:05:00.140921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2506.16796","last_updated":"2026-04-13T02:17:17Z","snapshot_observed_at":"2026-08-11T13:01:02.022869Z","submitted_at":"2025-06-20T07:21:21Z","title":"RealSR-R1: Reinforcement Learning for Real-World Image Super-Resolution with Vision-Language Chain-of-Thought","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-19T08:32:20.566798Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2506.16796"},"observation_digest":"sha256:44dc073e6a4f531b2ad8ba005ea6ec0526eeda7aa25a56301d6b5f129340023f","observation_id":"8cce00cd-11e6-4d63-954a-b2f9934dd839","resolution":{"observed_at":"2026-05-19T08:33:02.136479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-06T21:49:43.534834Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23347","last_updated":"2025-07-07T16:20:58Z","snapshot_observed_at":"2026-08-08T19:09:33.549872Z","submitted_at":"2025-06-29T17:43:04Z","title":"CycleVAR: Repurposing Autoregressive Model for Unsupervised One-Step Image Translation","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:49:43.534834Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2506.23347"},"observation_digest":"sha256:afa11f1b1f4bbed92f2c51b9eb1ad7a4090fd9a878acebee08cc8be89cb8a6ed","observation_id":"5ea88251-6d04-4cff-842b-fd6359a7cac2","resolution":{"observed_at":"2026-08-06T21:49:43.534834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-06T19:41:23.716761Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.04947","last_updated":"2025-07-07T12:45:23Z","snapshot_observed_at":"2026-08-10T07:36:03.612176Z","submitted_at":"2025-07-07T12:45:23Z","title":"DC-AR: Efficient Masked Autoregressive Image Generation with Deep Compression Hybrid Tokenizer","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T19:41:23.716761Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2507.04947"},"observation_digest":"sha256:0e687c40704f497ff6da12c638c2c9d7ebe4094b701f2c2dd84c66c990dd9ce1","observation_id":"d2bd89df-c72d-4e5d-8a5c-2f7b2e9f196a","resolution":{"observed_at":"2026-08-06T19:41:23.716761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-06T16:37:35.505153Z","title":"Lumina- mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.13032","last_updated":"2025-07-17T12:02:38Z","snapshot_observed_at":"2026-08-09T15:21:06.122858Z","submitted_at":"2025-07-17T12:02:38Z","title":"Resurrect Mask AutoRegressive Modeling for Efficient and Scalable Image Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T16:37:35.505153Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2507.13032"},"observation_digest":"sha256:d6bb5020bc7d4da9777cd204c13fd422234a1e1994ea3990e4695fbbf35035f5","observation_id":"5bc01014-fdca-4031-bfd8-854eff4a6a24","resolution":{"observed_at":"2026-08-06T16:37:35.505153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-05T23:23:58.677295Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.05399","last_updated":"2025-08-07T13:51:17Z","snapshot_observed_at":"2026-08-09T22:31:52.518397Z","submitted_at":"2025-08-07T13:51:17Z","title":"UNCAGE: Contrastive Attention Guidance for Masked Generative Transformers in Text-to-Image Generation","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T23:23:58.677295Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2508.05399"},"observation_digest":"sha256:209b1c59e8ff709c0b69fbb4ddd8b159396707e70b31323de2dab2f52dd6c8ee","observation_id":"59f2878a-3c54-45c2-be29-4e07cec1fb49","resolution":{"observed_at":"2026-08-05T23:23:58.677295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-05T05:36:53.233971Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.05169","last_updated":"2025-09-05T15:09:49Z","snapshot_observed_at":"2026-08-09T10:05:52.794674Z","submitted_at":"2025-09-05T15:09:49Z","title":"Exploring Autoregressive Vision Foundation Models for Image Compression","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T05:36:53.233971Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2509.05169"},"observation_digest":"sha256:8a3b07194fc85902c74574d73a325bfab8d3e1132ae7aa72cdb38046e76a38e1","observation_id":"0905e324-4926-43f8-972c-984ff983303d","resolution":{"observed_at":"2026-08-05T05:36:53.233971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2510.24211","last_updated":"2026-05-05T17:15:37Z","snapshot_observed_at":"2026-07-06T22:34:13.674208Z","submitted_at":"2025-10-28T09:26:27Z","title":"Speculative Coupled Decoding for Training-Free Lossless Acceleration of Autoregressive Visual Generation","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T03:20:35.021120Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2510.24211"},"observation_digest":"sha256:4b4e4c8780eff0f2abfbd8b2ea9e24c70462b3528ab98e65e4151d26ba6bffc2","observation_id":"5a58b564-e316-4d5e-a931-3b5911feffed","resolution":{"observed_at":"2026-05-18T03:20:48.740044Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2511.13587","last_updated":"2026-05-06T17:25:23Z","snapshot_observed_at":"2026-08-11T19:54:58.969538Z","submitted_at":"2025-11-17T16:50:58Z","title":"VVS: Accelerating Speculative Decoding for Visual Autoregressive Generation via Partial Verification Skipping","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-17T21:34:14.371914Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2511.13587"},"observation_digest":"sha256:308a88dc5101699f5fe2fd7391a69d4bcb7c16e3824069d8bc786ae2b7887916","observation_id":"253ed8bd-367d-458c-8b6d-5b0899881c0e","resolution":{"observed_at":"2026-05-17T21:35:17.580852Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2512.19433","last_updated":"2026-04-08T06:02:03Z","snapshot_observed_at":"2026-08-11T06:37:49.595265Z","submitted_at":"2025-12-22T14:31:58Z","title":"dMLLM-TTS: Self-Verified and Efficient Test-Time Scaling for Diffusion Multi-Modal Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T20:38:06.225705Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2512.19433"},"observation_digest":"sha256:9a03da9abe66aaa29f8108bbd6938de9121ca343c332b23d9bd514988038a8dd","observation_id":"5d334b33-de6f-4a3d-a3ab-566b9c84a901","resolution":{"observed_at":"2026-05-16T20:38:24.554015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-13T22:30:39.049531Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text- to-image generation with multimodal generative pretraining","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.18599","last_updated":"2026-06-02T02:51:47Z","snapshot_observed_at":"2026-08-07T20:36:21.304711Z","submitted_at":"2026-03-19T08:15:18Z","title":"SJD-PAC: Accelerating Speculative Jacobi Decoding via Proactive Drafting and Adaptive Continuation","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-13T22:30:39.049531Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2603.18599"},"observation_digest":"sha256:6313631ca306bf82df33fbdde3cccc66682a75659e2273bce0a7d4725e0eb2cf","observation_id":"68de935d-430c-48c8-b6cd-1b6821744d63","resolution":{"observed_at":"2026-07-13T22:30:39.049531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2603.28049","last_updated":"2026-06-29T03:15:39Z","snapshot_observed_at":"2026-08-11T16:42:58.450612Z","submitted_at":"2026-03-30T05:29:00Z","title":"Drift-AR: Single-Step Visual Autoregressive Generation via Anti-Symmetric Drifting","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-14T22:03:27.981438Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2603.28049"},"observation_digest":"sha256:0feb1b00015bd7ba9db7e4d43ea5a7165dd7aeec90e8c515ff5ba44e99d7875a","observation_id":"1849eba3-8fac-4819-b16b-f7b260442cf6","resolution":{"observed_at":"2026-05-14T22:08:04.950577Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2604.06966","last_updated":"2026-04-08T11:30:35Z","snapshot_observed_at":"2026-08-11T08:53:53.480489Z","submitted_at":"2026-04-08T11:30:35Z","title":"MAR-GRPO: Stabilized GRPO for AR-diffusion Hybrid Image Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:50.105629Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2604.06966"},"observation_digest":"sha256:81d4ddc681f9fda08f9c36bf2288a754611042746b15a5400a95055204ba940f","observation_id":"d2a25238-8249-4e0f-a039-27e2163dfca9","resolution":{"observed_at":"2026-05-11T05:40:58.100853Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2604.18572","last_updated":"2026-06-02T17:45:12Z","snapshot_observed_at":"2026-08-11T01:54:41.729630Z","submitted_at":"2026-04-20T17:56:02Z","title":"Back into Plato's Cave: Examining Cross-modal Representational Convergence at Scale","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-10T05:00:31.717115Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2604.18572"},"observation_digest":"sha256:bf97426f97da3a171660d508d78619eaa4f712f41d92a25dfc5061d7f369fa8b","observation_id":"47a61f61-ab51-416c-bde0-838e6bae69a0","resolution":{"observed_at":"2026-05-10T10:14:10.770184Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2604.24459","last_updated":"2026-04-27T13:28:57Z","snapshot_observed_at":"2026-08-02T15:00:52.552817Z","submitted_at":"2026-04-27T13:28:57Z","title":"TextGround4M: A Prompt-Aligned Dataset for Layout-Aware Text Rendering","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-08T04:26:58.529645Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2604.24459"},"observation_digest":"sha256:e27eb2b55977214d3a580da9baee180f352d9e36215cdf2ec3c32d53dc1ffa33","observation_id":"a4c460ff-9f89-481a-b00c-da3616c772c1","resolution":{"observed_at":"2026-05-11T21:46:37.722392Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2605.06481","last_updated":"2026-05-07T16:06:08Z","snapshot_observed_at":"2026-08-11T07:38:44.239882Z","submitted_at":"2026-05-07T16:06:08Z","title":"OA-WAM: Object-Addressable World Action Model for Robust Robot Manipulation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-08T08:52:07.545191Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2605.06481"},"observation_digest":"sha256:5eb50184e783e1980be0e467dbbb089d6ccc4622aa36b9036de02a0f84c27e9b","observation_id":"51cdcfe1-67c0-418a-9f68-24f7917fab1b","resolution":{"observed_at":"2026-05-11T20:31:11.069089Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2605.07230","last_updated":"2026-05-08T04:32:17Z","snapshot_observed_at":"2026-08-01T04:13:43.004857Z","submitted_at":"2026-05-08T04:32:17Z","title":"CASCADE: Context-Aware Relaxation for Speculative Image Decoding","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-11T02:08:27.374066Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2605.07230"},"observation_digest":"sha256:a7ec4ce7c2840c9cd44e9c5173d966b54512e9714cb5981a62a5a827571bf847","observation_id":"12335dc9-37c8-408d-8b8d-b255ea492955","resolution":{"observed_at":"2026-05-11T03:55:55.170887Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2605.09430","last_updated":"2026-05-12T03:20:13Z","snapshot_observed_at":"2026-08-11T17:42:33.954571Z","submitted_at":"2026-05-10T09:07:20Z","title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:20:25.071428Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2605.09430"},"observation_digest":"sha256:645226217b24d0fe4ae6547b00182d36dc65467d67e033aa70d352d6b35d7d69","observation_id":"6784e666-fbbb-45ff-a168-3c220c213ace","resolution":{"observed_at":"2026-05-12T02:21:16.463596Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2605.09430","last_updated":"2026-05-12T03:20:13Z","snapshot_observed_at":"2026-08-11T17:42:33.954571Z","submitted_at":"2026-05-10T09:07:20Z","title":"FlashAR: Efficient Post-Training Acceleration for Autoregressive Image Generation","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T05:54:24.248910Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2605.09430"},"observation_digest":"sha256:3e12306d9db81f2594b11be9807e49cb040725986f2f683271b9c61dda6a42eb","observation_id":"23a5030c-42ef-4c75-8a0a-fd9a0293c645","resolution":{"observed_at":"2026-05-13T06:02:23.659868Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2605.10564","last_updated":"2026-05-11T13:36:51Z","snapshot_observed_at":"2026-08-11T14:22:52.114253Z","submitted_at":"2026-05-11T13:36:51Z","title":"DeepSight: Long-Horizon World Modeling via Latent States Prediction for End-to-End Autonomous Driving","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-05-12T04:13:37.421188Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2605.10564"},"observation_digest":"sha256:b2454a14411bc290975261d85d291cec5f03876f5683bf027a03d1b9df38f83e","observation_id":"f8f0abe7-a300-4f66-ba5a-538d9d175aa8","resolution":{"observed_at":"2026-05-12T06:31:26.229126Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2605.14891","last_updated":"2026-05-14T14:35:51Z","snapshot_observed_at":"2026-08-06T21:59:26.421190Z","submitted_at":"2026-05-14T14:35:51Z","title":"Hierarchical Image Tokenization for Multi-Scale Image Super Resolution","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T21:11:36.019938Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2605.14891"},"observation_digest":"sha256:e3f748ebd6426515d4befa6877a34339207324ccc72c61932d4f2e423aa816f3","observation_id":"8389d4b9-e0ff-4288-9d2a-07a3b79fa962","resolution":{"observed_at":"2026-06-30T21:15:04.280295Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2606.00310","last_updated":"2026-05-29T19:34:39Z","snapshot_observed_at":"2026-08-02T19:03:39.307951Z","submitted_at":"2026-05-29T19:34:39Z","title":"Where to Refine, When to Stop: Rethinking Redundancy via Latent Discrepancy for Efficient Visual Autoregressive Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T22:38:26.147074Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2606.00310"},"observation_digest":"sha256:36a2908a74e04a04f3422f04196f02549e03510af80f4271dfd494b87cbb74a2","observation_id":"ff6b55aa-22f3-4d85-86b6-41417a31e54b","resolution":{"observed_at":"2026-06-28T22:42:46.717969Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2606.01858","last_updated":"2026-06-01T08:10:25Z","snapshot_observed_at":"2026-07-06T23:42:21.252086Z","submitted_at":"2026-06-01T08:10:25Z","title":"Polaris: Scaling Up Instruction-Guided Image Generation Towards Millions of Personalized Style Needs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-28T15:07:03.439928Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2606.01858"},"observation_digest":"sha256:40b3a9a5bf58a8f35749ee3d36a2a7fea81c4c1c316812fee8f8c312a909be67","observation_id":"e145c616-d838-4db0-907f-0ff8c6e91adf","resolution":{"observed_at":"2026-07-01T22:46:18.719326Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2606.05703","last_updated":"2026-06-04T04:50:22Z","snapshot_observed_at":"2026-08-01T16:29:35.905350Z","submitted_at":"2026-06-04T04:50:22Z","title":"Parallel Jacobi Decoding for Fast Autoregressive Image Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T02:05:58.714029Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2606.05703"},"observation_digest":"sha256:5a63fa7b4e7405337acba7f8a534378358cb06f052844c74fd48de77aa83e63c","observation_id":"01af4b66-d9ae-4ba2-83dc-32fef732688e","resolution":{"observed_at":"2026-07-02T12:26:57.136218Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2606.06078","last_updated":"2026-06-04T12:15:31Z","snapshot_observed_at":"2026-07-06T23:45:56.266116Z","submitted_at":"2026-06-04T12:15:31Z","title":"Knowledge Distillation for Visual Autoregressive Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T01:59:51.409952Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2606.06078"},"observation_digest":"sha256:56616c97f21058e27e3e46189d37763d279f829c3210be161e9290fe69001244","observation_id":"b02c2aed-bc8b-4cb6-afa6-d86d8910cb60","resolution":{"observed_at":"2026-07-02T12:36:56.883793Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":"2408.02657","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-04T03:49:30.628376Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal gener- ative pretraining, 2024a","venue":null,"work_id":"c0d2d00b-1774-4161-8f99-a6e142cfa281","year":2024},"citing_paper":{"arxiv_id":"2606.20543","last_updated":"2026-06-18T17:52:30Z","snapshot_observed_at":"2026-08-01T10:11:43.938198Z","submitted_at":"2026-06-18T17:52:30Z","title":"SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-26T17:36:26.762881Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2606.20543"},"observation_digest":"sha256:7dba4f21b747a7afbb9d0070695bb16334f548511754153e29383c6c3e639ce8","observation_id":"2eb5c7f6-2ff7-426a-a41f-52ab3fd1cc5b","resolution":{"observed_at":"2026-07-04T03:49:30.630557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-07-11T15:05:11.166049Z","title":"arXiv preprint arXiv:2408.02657 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04691","last_updated":"2026-07-06T05:36:30Z","snapshot_observed_at":"2026-08-03T05:10:53.451231Z","submitted_at":"2026-07-06T05:36:30Z","title":"From Open Loop to Closed Loop: A Test-Time Iterative Optimization Framework for Reference-Consistent Image Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-11T15:05:11.166049Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2607.04691"},"observation_digest":"sha256:00829b59d087dd13c3627d3938c51fed97529191335b48b461fc695727fcc765","observation_id":"30cbcc5d-0224-4654-a5f0-3a94e05ddaf5","resolution":{"observed_at":"2026-07-11T15:05:11.166049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-01T21:07:59.570641Z","title":"Lumina-mgpt: Illuminate flexible photorealistic text-to-image generation with multimodal generative pretraining, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16409","last_updated":"2026-07-17T18:02:44Z","snapshot_observed_at":"2026-08-11T19:44:36.914847Z","submitted_at":"2026-07-17T18:02:44Z","title":"Think, Plan, Paint: Layout-Aware Reasoning for Controllable Image Generation in Unified Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:07:59.570641Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2607.16409"},"observation_digest":"sha256:f6d455cc59bf6ce1394263340148940f3c34e12b178fe998a7c34432ef6db45b","observation_id":"d14b4f97-c2a7-4db3-acd5-ff77c4eea622","resolution":{"observed_at":"2026-08-01T21:07:59.570641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.02657","snapshot_observed_at":"2026-08-12T00:44:45.940588Z","title":"arXiv preprint arXiv:2408.02657 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.07948","last_updated":"2026-08-08T06:23:48Z","snapshot_observed_at":"2026-08-12T03:14:00.689595Z","submitted_at":"2026-08-08T06:23:48Z","title":"SynVAR: Synergizing Spatial and Semantic Alignment in Visual Autoregressive Model","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T00:44:45.940588Z"},"links":{"cited_paper":"/paper/2408.02657","citing_paper":"/paper/2608.07948"},"observation_digest":"sha256:c2f0549057299aced26c60bc0a5ae47f8dc97a132868d9fddfeaebbe31afe0ba","observation_id":"d4586da7-a100-48dc-81c0-b86d38c43ba2","resolution":{"observed_at":"2026-08-12T00:44:45.940588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2408.02657/citation-record","integrity":"/paper/2408.02657/integrity","json":"/paper/2408.02657/citation-record.json","paper":"/paper/2408.02657"},"outbound":[],"paper":{"arxiv_id":"2408.02657","last_updated":"2025-04-24T16:16:27Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:40:56.937227Z","submitted_at":"2024-08-05T17:46:53Z","title":"Lumina-mGPT: Illuminate Flexible Photorealistic Text-to-Image Generation with Multimodal Generative Pretraining"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 46 inbound Pith citation observations for arXiv:2408.02657."}